# Meta 10万 GPU 超の大規模クラスタを運用する企業。集合通信ライブラリ NCCLX とその通信レイヤ CTran の開発主体であり、10万+GPU 規模での集合通信([[@2025__arXiv__Collective Communication for 100k+ GPUs]])を報告する。(Source: [[@2025__arXiv__Collective Communication for 100k+ GPUs]]) また、DCN 設計自動化システム Matryoshka を 6 年以上本番運用し、70 以上のリージョン・18 種類・約 900 DCN のスイッチ設定生成を完全自動化している。最新の 10 万 GPU AI スーパークラスタの設計・配備も Matryoshka が支えた。(Source: [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]]) [[Meta AI Research SuperCluster]] の RSC-1/RSC-2 を対象にした信頼性分析も公開している。[[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]] は、16k A100 GPU の RSC-1 と 8k A100 GPU の RSC-2 から 11 か月・4 百万ジョブ・1.5 億超 A100 GPU 時間を分析し、MTTF のスケール則、ETTR 推定、レモンノード検知、InfiniBand 適応ルーティングを報告した。(Source: [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]]) SIGCOMM 2024 では AI 訓練向け大規模 RoCE ネットワークの設計・実装・運用経験を初めて詳述した([[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]])。数万 GPU 規模(最大 24,000 GPU)のバックエンドネットワークを RoCEv2 で構築し、ルーティング進化(ECMP → 拡張 ECMP → 集中型 TE → フローレットスイッチング)および DCQCN を廃止して集合ライブラリ層の受信側駆動制御へ転換した経験を報告した。Llama 3 の大型変形モデルはこのクラスタ上の 16,000 GPU で訓練された。(Source: [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]]) System@Scale 2023 では [[Valentin Andrei]] らが AI ワークロード向け 4 層オブザーバビリティスタック([[Dynolog]]・[[LibAsicMon]]・[[Kineto]]・Gpusnoop)を公開した([[@2023__SystemAtScale__AI Observability]])。観測性を「インフラが達成した性能レベルを評価する技術・ツール・データセット・ダッシュボードの総体」と定義し、ジョブ/ユーザー/モデル/プロダクト別の FLOPs/sec と rDevice hour/Byte でフリート全体を可視化する構成を示した。(Source: [[@2023__SystemAtScale__AI Observability]]) Meta のネットワーク部門研究者([[Kayvon Shakeri]]・[[Ying Zhang]]・[[Naader Hasani]])は MIT CSAIL の [[Manya Ghobadi]] らと共同で Rail-only アーキテクチャ(arXiv 2307.12169)を発表した。LLM 訓練のスパース通信パターンを実測分析し、スパイン層除去によるコスト 38〜77% 削減を提案したもので、Meta の大規模クラスタ運用知見が活用されている。(Source: [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]]) ## 関連 - ソース: [[@2023__SystemAtScale__AI Observability]] / [[@2025__arXiv__Collective Communication for 100k+ GPUs]] / [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]] / [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]] / [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]] / [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]] - 概念: [[集合通信]] / [[LLM分散学習]] / [[オープンネットワーキング]] / [[GPUクラスタ運用]] / [[耐障害LLM訓練]] / [[RDMA]] / [[Fat-Tree]] / [[GPU観測性]] - エンティティ: [[Valentin Andrei]] / [[Dynolog]] / [[LibAsicMon]] / [[Kineto]] / [[James Hongyi Zeng]] / [[Adithya Gangidi]] / [[Rui Miao]] / [[Meta AI Research SuperCluster]] / [[Kayvon Shakeri]] / [[Ying Zhang]] / [[Naader Hasani]]