# GPUプーリング ## 定義 GPUプーリング(GPU仮想化)は、単一の物理 GPU/NPU を複数の論理デバイス(vGPU/vNPU)に分割し、コンピュートとメモリの両方を細粒度に制御することで、粗粒度なデバイス単位割り当てに起因する資源断片化・低利用率・長いキューイング遅延を解消する技術である。[[gPooling]] は実装レイヤーの違いにより、ハードウェアベンダー解(MPS・MIG・vGPU)・API 傍受方式(Salus・Orion・gRemote)・ドライバレベル方式(gPooling)の3系統に大別されると位置づける。(Source: [[@2026__IEEE TPDS__gPooling - An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters]]) ## 横断的知見 - (2ソース目以降の突き合わせで蓄積する。現時点では [[gPooling]] 単独の知見のみのため、単一ソースの事実は本節でなく定義・source ページ側に記載する。) ## 未解決の問い - [[gPooling]] はドライバレベルのチャネル傍受により CUDA 層より下で正確なプリエンプションを実現すると主張するが、この設計は MIG のようなハードウェアパーティショニングと比べてマイクロアーキテクチャレベルのサイドチャネル分離をどこまで犠牲にしているか。定量的なセキュリティ評価は今後のソースで補う必要がある。 - gPooling の利用率フィードバック機構は、1%のような極端に小さいコンピュートクォータでは既存ソリューション以上にオーバーシュートする(約300% vs 約200%)。この精度劣化は時分割多重方式に共通する限界か、gPooling 固有の実装課題か。 - ドライバレベル傍受方式(gPooling)と API 傍受方式(Salus・Orion・gRemote)のオーバーヘッド・精度のトレードオフを、同一ベンチマーク・同一ハードウェアで直接比較した定量データはまだない。 - gPooling は NVIDIA GPU と Huawei Ascend NPU の統一アーキテクチャを実証したが、AMD ROCm や Intel Gaudi など他のアクセラレータへの拡張時にドライバレベル傍受アプローチがどこまで再利用可能か。 - 弾力的な仮想化比率(gPooling の本番デプロイでは経験的に3:1に決定)を、ワークロード特性から自動的にチューニングする仕組みはまだ確立されていない。 ## 関連 - ソース: [[@2026__IEEE TPDS__gPooling - An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters]] - エンティティ: [[gPooling]] / [[Shanghai Jiao Tong University]] / [[Huawei Technologies]] - 概念: [[GPUクラスタスケジューリング]](gPooling が補完するスケジューラ上位層) / [[GPUクラスタ運用]] ## 出典 - [[@2026__IEEE TPDS__gPooling - An Elastic GPU Resource Management Framework for On-Demand Virtualization in Shared Accelerator Clusters]](§II 動機付けトレース、§III アーキテクチャ・コンピュート/メモリ制御、§V 評価、§VI 関連研究の3系統分類)