# メッシュトポロジ ## 定義 メッシュトポロジ(mesh topology)は、並列計算機やマルチGPUシステムにおいて、各ノードまたはプロセッサが直接リンク(点対点リンク)を介して相互に接続されるネットワーク接続形態である。特に、ノード内のすべてのGPUペア間に直接の双方向通信リンクが張り巡らされた形態を**フルメッシュトポロジ(full-mesh topology、完全結合メッシュ)**と呼ぶ。 NVSwitchやInfiniBandスイッチなどの集中型スイッチハードウェアを介して全エンドポイントが均一に接続される**スター型トポロジ(star topology)**と対比される。 ## 主要な特徴と設計課題 ### フルメッシュ型とスター型のアーキテクチャ比較 1. **スイッチレス直接接続**: フルメッシュトポロジでは、専用のスイッチASIC(例: NVSwitch)を搭載する必要がなく、GPU同士のインターコネクトポート(例: NVIDIA NVLink 3.0やInfinity Fabric)を直接対向配線する。ハードウェアコストを抑制しつつ、対向GPU間では最短の物理遅延(単一ホップ)と専用帯域を享受できる。東京科学大学のスーパーコンピュータ TSUBAME4.0 の計算ノード(H100 SXM5 4基)などで採用されている。 2. **スケーラビリティの限界**: フルメッシュではノード内GPU数を $N$ とすると必要なリンク数が $N(N-1)/2$ で増加するため、GPUが持つ物理ポート数(H100では最大18ポート)の制約から、実用的なフルメッシュ接続は1ノードあたり4〜8基程度に制限される。それ以上のGPUを結合するにはスター型トポロジ(DGX H100などのNVSwitch構成)や階層型トポロジが必要となる。 ### 集合通信アルゴリズムとの相互作用 フルメッシュトポロジは、物理リンクの配置構造が集合通信(Collective Communication)の実効帯域に強い影響を与える。 - **マルチリング(Multi-ring)アルゴリズムによる帯域飽和**: NCCLなどの通信ライブラリは、フルメッシュ接続を検出すると複数の独立した論理リング(例: 4 GPU環境において 0->1->3->2->0、0->2->1->3->0、0->3->2->1->0 およびそれぞれの逆順リング)を並行して構築する。これにより、すべての物理NVLinkリンクにトラフィックを分散させ、ノード内の全リンク集約帯域を100%飽和させることができる。 - **トポロジ非依存な通信分割(P2P分解)の破綻**: これに対し、通信計算オーバーラップを目的として集合通信(All-Gatherなど)を単一リングの逐次P2P転送に分解する手法をフルメッシュ環境に適用すると、各GPUがリング上の隣接ノードとしか通信しなくなり、他の直接NVLinkリンクが完全に遊休化する。この結果、実効通信時間が倍増し、オーバーラップによる計算隠蔽の利益を打ち消して深刻な性能劣化を招くことが Hosoki et al. ([[@2026__HPCA__Optimizing Intra-Layer Parallel Communication for LLM Training on Systems with Fully-Connected Mesh GPU Topology]]) によって明らかにされた。 ## 未編纂の観察 - [フルメッシュGPU環境における集合通信最適化のトポロジ依存性] フルメッシュ型GPUノードでは、集合通信をP2P転送に分解して部分GEMMと重ねる既存のパイプライン化オーバーラップが物理リンクの遊休化を引き起こすため、通信カーネルを無傷のマルチリング集合通信のまま維持し、下流依存のない重み勾配(wgrad)計算を遅延させて並行実行する再スケジューリング型アプローチ(AG-WGRAD)が極めて有効である。(Source: [[@2026__HPCA__Optimizing Intra-Layer Parallel Communication for LLM Training on Systems with Fully-Connected Mesh GPU Topology]]) ## 未解決の問い - フルメッシュ接続ノードを複数跨ぐマルチノード層内並列において、ノード内のマルチリングNVLinkとノード間のマルチレールInfiniBand/RoCE(例: 4レール)を統合した最適な階層型集合通信リングのトポロジ合成はどうあるべきか。 - 8 GPU以上のフルメッシュまたは準メッシュ(部分的メッシュ)接続において、集合通信のマルチリング構築コストとリンク競合を最小化する静的・動的ルーティングの最適化境界はどこにあるか。 ## 関連 - ソース: [[@2026__HPCA__Optimizing Intra-Layer Parallel Communication for LLM Training on Systems with Fully-Connected Mesh GPU Topology]] / [[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]] - 概念: [[集合通信]] / [[NVLink]] / [[並列化戦略]] / [[テンソル並列]] / [[通信計算オーバーラップ]] - エンティティ: [[NVIDIA]] / [[東京科学大学]] - 関連 MOC: [[分散深層学習 - MOC]] ## 出典 - [[@2026__HPCA__Optimizing Intra-Layer Parallel Communication for LLM Training on Systems with Fully-Connected Mesh GPU Topology]](フルメッシュトポロジにおけるNCCLマルチリング集合通信と単一リングP2P分解の性能特性比較、およびAG-WGRADオーバーラップの提案) - [[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]](GPUインターコネクトにおけるNVLink直接メッシュ接続とNVSwitchスター型接続のNUMA特性分析)