# APU
## 定義
APU(Accelerated Processing Unit)とは、汎用CPUコア(Zen 4等)と高並列GPUコンピュートユニット(CDNA 3等)を単一の物理パッケージ上に集積し、コヒーレントな高帯域インターコネクト(Infinity Fabric等)と物理的に統一された高帯域幅メモリ(HBM等)を共有するヘテロジニアス・プロセッサアーキテクチャである。([[@2026__HPCA__GPU Partitioning, Power, and Performance of the AMD MI300A]])
## アーキテクチャ的特徴
1. **統一物理メモリ空間**: CPUとGPUが同一のHBMプール(例: 128 GB)を物理的に共有し、PCIeバスを経由したホスト・デバイス間の明示的なメモリアドレスコピーを完全に排除する。
2. **チップレット混載構造**: CPUダイ(CCD)とGPUアクセラレータダイ(XCD)が独立したダイとして製造され、インターポーザや基板上で高密度接続される。
3. **共有TDPと熱・電力の統合管理**: CPUコアとGPUコンピュートユニットが単一ソケットの電力バジェット(例: 550W TDP)を共有し、動的電力融通を行う。
## 利点と課題
- **プログラマビリティと低遅延連携**: ゼロコピーでのポインタ渡しが可能になり、CPU主導の前処理・グラフ探索とGPU主導の大規模行列演算の協調が極めて低レイテンシで実現する。
- **熱・電力の競合**: 高密度集積のため、全CPUコアと全GPUダイを同時に最大クロックで駆動するとTDP上限に達しやすく、動的周波数スロットリングが発生する。
## 関連
- ソース: [[@2026__HPCA__GPU Partitioning, Power, and Performance of the AMD MI300A]] / [[@2025__MemSys__Inter-APU Communication on AMD MI300A Systems via Infinity Fabric - A Deep Dive]] / [[@2024__ISCA__Realizing the AMD Exascale Heterogeneous Processor Vision]]
- 概念: [[チップレット]] / [[High Bandwidth Memory]] / [[NUMAメモリ配置]] / [[動的電力共有]] / [[GPUパーティショニング]] / [[統合メモリ]] / [[ハイブリッドボンディング]]
- エンティティ: [[AMD Instinct MI300A]] / [[AMD]] / [[Infinity Fabric]] / [[Exascale Heterogeneous Processor]]
## 未編纂の観察
- **同一ダイ上のHBM共有によるノードNUMA構成**: MI300Aでは1ノードに4基のAPUが搭載され、各APUソケットが128 GBのHBMを持つ独立NUMAドメイン(ノード計512 GB)を形成する。CPUとGPUが同一ソケット内で同一NUMAノードに属するため、CPU-GPU間のNUMA距離ペナルティが解消される。(Source: [[@2026__HPCA__GPU Partitioning, Power, and Performance of the AMD MI300A]])
- [NUMA構成] 4 基の MI300A ノードでは全 APU 対が同一帯域の Infinity Fabric 2 本(片方向 128 GB/s)で直結される。GPU カーネルからの直接アクセスは理論値の約 81%(103〜104 GB/s)で、遠隔メモリのレイテンシは局所の約 2 倍(CPU 240→500 ns、GPU 346→690 ns)である。(Source: [[@2025__MemSys__Inter-APU Communication on AMD MI300A Systems via Infinity Fabric - A Deep Dive]])
- 統合物理メモリでも CPU と GPU は別のページテーブルを持ち、通信帯域はアロケータで変わる。hipMalloc のバッファだけが最大帯域(hipMemcpy 90 GB/s)に達し、malloc は CPU 側 memcpy に落ちて 20 GB/s 未満になる。(Source: [[@2025__MemSys__Inter-APU Communication on AMD MI300A Systems via Infinity Fabric - A Deep Dive]])
- **HPC 用 APU の実現時期と設計の制約**: AMD の EHP 構想は、量産可能なヘテロジニアス統合が成熟するまで [[Frontier]] では離散 GPU 構成となった。EHPv4 はサーバー用 IOD の流用が HBM 中心の構成に合わず、MI300A は専用 IOD の上に CCD と XCD をハイブリッドボンディングで積んで実現した。(Source: [[@2024__ISCA__Realizing the AMD Exascale Heterogeneous Processor Vision]])
## 未解決の問い
- CPUとGPUが同時にHBMへ集中アクセスした際、Infinity Fabricの調停(Arbiter)における優先度制御はスループットとテールレイテンシにどう作用するか。
- 統合物理メモリの APU で、malloc 領域を GPU 主体のコピー経路(SDMA / blit)へ載せる方法はあるか。hipHostRegister 以外の手段は評価されていない。
## 出典
- [[@2024__ISCA__Realizing the AMD Exascale Heterogeneous Processor Vision]](根拠)