# Fat-Tree
## 定義
Fat-Tree は、上位階層へ行くほどリンク帯域または並列経路を太くして、リーフ間通信のボトルネックを避けるデータセンターネットワークトポロジである。AI/HPC クラスタでは GPU ノード間の all-to-all / all-reduce 通信を支える基盤として、Clos 型 fabric や rail-optimized topology と併用される。
## 横断的知見
- [[Hawkeye]] は K=4 Fat-Tree(20 スイッチ)を評価環境に使い、PFC provenance graph による RDMA 異常診断を示した。([[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]])
- [[SAKURAONE]] は open Ethernet/RoCEv2 で rail-optimized leaf-spine を構成し、Fat-Tree/Clos 系の多経路設計を AI HPC へ適用する実例を与える。([[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]])
- LLM 訓練では物理トポロジが並列化配分と直接結びつく。pipeline parallelism が pod を跨ぐと通信比率が上がり、MFU が低下する。
- **Fat-Tree と [[Dragonflyトポロジ]] のコスト構造は本質的に異なる**: Fat-Tree は直径が小さく適応ルーティング不要だが、全体帯域を確保するため上位スイッチに多数のポートを集約し、大規模化でスイッチコストが急増する。Dragonfly は直径 3 だが、接続数を O(N^(2/3)) から O(N^(1/2)) に削減でき、大規模時のケーブルコスト比で 2 倍以上の優位性を持つ。ただし Dragonfly は敵対的トラフィックパターンで適応ルーティングを要し、実装の複雑さが増す。(Source: [[@2008__ISCA__Technology-Driven, Highly-Scalable Dragonfly Topology]], [[@2009__IEEE-Micro__Cost-Efficient Dragonfly Topology for Large-Scale Systems]])
- **Rail-only トポロジは Fat-Tree のスパイン層を完全に削除する**: [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]] は LLM 訓練のスパースな通信パターンに着目し、スパイン層を削除してコスト 38-77%・消費電力 37-75% を削減しつつ訓練性能を維持できることを示した。Fat-Tree が提供する全二分帯域は LLM 訓練では大半が未使用であるという観察が、このアーキテクチャを正当化している。(Source: [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]])
- **[[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning|HammingMesh]] は Fat-Tree のサブネットワークを符号理論で最適に繋ぐ**: [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning]] は、2 次元並列化に対して完全帯域分離を提供しつつ、汎用トラフィック用のグローバル帯域も維持する。Fat-Tree が提供する均一な全二分帯域に対し、HammingMesh は AI ワークロードの通信局所性に特化することで低コスト化を実現する。(Source: [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning]])
## 未解決の問い
- Fat-Tree 上の RDMA/PFC 異常診断は、評価用 K=4 より大きい多テナント fabric で線速を保てるか。
- AI 訓練の並列化構成(TP/PP/DP/EP)に対し、Fat-Tree、rail-only、Dragonfly、HammingMesh のどれが最も扱いやすいか。ワークロードの MoE 化が進むと all-to-all 通信が増え、Rail-only の前提(スパース通信)が崩れる可能性がある。
- Fat-Tree の全二分帯域保証は、AI 訓練以外のマルチテナントワークロード(ストレージ・RPC 等)との混在環境で引き続き必要か。ワークロード特化トポロジ(Dragonfly/HammingMesh/Rail-only)はマルチテナント運用にどう適応できるか。
## 関連
- 概念: [[RDMA]] / [[オープンネットワーキング]] / [[RDMAネットワーク監視]] / [[LLM分散学習]] / [[並列化戦略]]
- ソース: [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]] / [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] / [[@2008__ISCA__Technology-Driven, Highly-Scalable Dragonfly Topology]] / [[@2022__SC__HammingMesh - A Network Topology for Large-Scale Deep Learning]] / [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]]
## 出典
- [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]]
- [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]