# Meta 10万 GPU 超の大規模クラスタを運用する企業。集合通信ライブラリ NCCLX とその通信レイヤ CTran の開発主体であり、10万+GPU 規模での集合通信([[@2025__arXiv__Collective Communication for 100k+ GPUs]])を報告する。(Source: [[@2025__arXiv__Collective Communication for 100k+ GPUs]]) - [[Purdue University]] と共同で、全ホストに展開したeBPFベースの軽量トラフィック計測ツールMillisampler/SyncMillisamplerを用い、ラック共有バッファにおけるバースト・輻輳(contention)・パケット損失の関係を大規模実測した(IMC '22)。輻輳が高いほど損失が多いとは限らないという非自明な発見を報告する。(Source: [[@2022__IMC__A Microscopic View of Bursts, Buffer Contention, and Loss in Data Centers]]) SIGCOMM 2026 では、10 万+ GPU が複数のデータセンタ建屋にまたがる Cluster の通信スタック全体を報告した([[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]])。建屋間リンクのレイテンシがラック内比最大 30 倍に達する多建屋トポロジと MoE 由来のバースト All-to-All トラフィックという 2 つの制約に対し、通信ライブラリ CCLX(NVIDIA 版 NCCLX・AMD 版 RCCLX)の初期化・メモリ管理最適化、トランスポート層の Dynamic Queue Pair Load Balancing(DQPLB)、CollTrace ベースの Fault Analyzer や libcuda/libibverbs モック化による分散 CPU エミュレーションといった運用ツール群を co-design した。5 DC 建屋・約 129,000 台の H100 GPU から成る Grand Teton ベースの Cluster で、初期化を 96K GPU 規模で最大 11 倍高速化(265.0秒→24.0秒)、通信子あたり GPU メモリ使用量を 64K GPU 規模で約 2 倍削減したと報告する。(Source: [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]]) また、DCN 設計自動化システム Matryoshka を 6 年以上本番運用し、70 以上のリージョン・18 種類・約 900 DCN のスイッチ設定生成を完全自動化している。最新の 10 万 GPU AI スーパークラスタの設計・配備も Matryoshka が支えた。(Source: [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]]) [[Meta AI Research SuperCluster]] の RSC-1/RSC-2 を対象にした信頼性分析も公開している。[[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]] は、16k A100 GPU の RSC-1 と 8k A100 GPU の RSC-2 から 11 か月・4 百万ジョブ・1.5 億超 A100 GPU 時間を分析し、MTTF のスケール則、ETTR 推定、レモンノード検知、InfiniBand 適応ルーティングを報告した。(Source: [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]]) SIGCOMM 2024 では AI 訓練向け大規模 RoCE ネットワークの設計・実装・運用経験を初めて詳述した([[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]])。数万 GPU 規模(最大 24,000 GPU)のバックエンドネットワークを RoCEv2 で構築し、ルーティング進化(ECMP → 拡張 ECMP → 集中型 TE → フローレットスイッチング)および DCQCN を廃止して集合ライブラリ層の受信側駆動制御へ転換した経験を報告した。Llama 3 の大型変形モデルはこのクラスタ上の 16,000 GPU で訓練された。(Source: [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]]) System@Scale 2023 では [[Valentin Andrei]] らが AI ワークロード向け 4 層オブザーバビリティスタック([[Dynolog]]・[[LibAsicMon]]・[[Kineto]]・Gpusnoop)を公開した([[@2023__SystemAtScale__AI Observability]])。観測性を「インフラが達成した性能レベルを評価する技術・ツール・データセット・ダッシュボードの総体」と定義し、ジョブ/ユーザー/モデル/プロダクト別の FLOPs/sec と rDevice hour/Byte でフリート全体を可視化する構成を示した。(Source: [[@2023__SystemAtScale__AI Observability]]) Meta のログ基盤としては、社内限定のホスト型・サーバレス・マルチテナントログサービス [[Logarithm]] を運用する([[@2024__EngineeringAtMeta__Logarithm - A logging engine for AI training workflows and services]])。100+GB/s のログをリアルタイムに索引化し、毎秒数千件のクエリを処理する。[[PyTorch]] の rank ID をログ行のメタデータとして付与する API により分散訓練のデバッグを支援し、内部デプロイの [[TensorBoard]] をストリーミング API で駆動してモデルテレメトリダッシュボードを提供する。System@Scale の 4 層スタック([[Dynolog]]・[[Kineto]] 等)が GPU/ハードウェアのメトリクス・トレースを中心に据えるのに対し、Logarithm はシステムログとモデルテレメトリを収集する log-based の系であり、両者は Meta の AI 観測性の異なる断面を覆う相補的な取り組みとして位置づけられる([[AI訓練ログデバッグ]])。(Source: [[@2024__EngineeringAtMeta__Logarithm - A logging engine for AI training workflows and services]]) Meta はさらに、訓練・推論の両方を対象にする自動性能プロファイリング/デバッグ/最適化プラットフォーム [[Zoomer]] を運用する。Zoomer は [[Kineto]]・[[Dynolog]]・NVIDIA DCGM・[[StrobeLight]]・[[Perfetto]] を一つの分析ループへ束ね、GPU メトリクス、実行トレース、ホストテレメトリ、集合通信、推論要求を統合してボトルネック検知と改善提案を行う。Meta は Ads 関連モデルの訓練時間 75% 短縮・電力消費 78% 削減、32k GPU ベンチマークの 30% 高速化などを Zoomer の効果として報告している。(Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]]) Meta のネットワーク部門研究者([[Kayvon Shakeri]]・[[Ying Zhang]]・[[Naader Hasani]])は MIT CSAIL の [[Manya Ghobadi]] らと共同で Rail-only アーキテクチャ(arXiv 2307.12169)を発表した。LLM 訓練のスパース通信パターンを実測分析し、スパイン層除去によるコスト 38〜77% 削減を提案したもので、Meta の大規模クラスタ運用知見が活用されている。(Source: [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]]) Software upgrade scheduling でも、Meta Infra Data Center チームが [[Purdue University]] の [[Yi Ding]] らと共同で、コストアウェア期間予測フレームワーク Acela を本番デプロイし、アップグレード窓利用率を1.25倍に改善した。(Source: [[@2026__MLSys2026__Cost-aware Duration Prediction for Software Upgrades in Datacenters]]) Meta Inference Team は月間アクティブユーザー約10億人規模で Llama モデルファミリーの推論を運用する知見を報告している([[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]])。数百万規模の展開構成(ハードウェア・並列化・ランタイム)を実測ベンチマーク駆動の軽量シミュレータで体系的に探索し、オンラインサービスの大半を [[Prefill-Decode分離]] ランタイムへ移行して約30%の容量削減、異種ハードウェアの Prefill/Decode 別割当で15〜25%の TCO 改善、Expert Parallelism による [[Mixture-of-Experts]] のスケールアウト活用など5つの知見を MLSys 2026 で公開した。(Source: [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]]) Meta Platforms の [[Omkar Salpekar]]・[[Rohan Varma]]・[[Chunqiang Tang]]・[[Maxim Naumov]] らは、10万 GPU 級の LLM 事前学習で完全同期訓練が構造的に破綻する(18分ごとに障害・復旧に10分要し有効訓練時間 44%)ことを実測で示し、データ並列レプリカを耐障害性の単位とする [[FT-HSDP]](Fault Tolerant Hybrid-Shared Data Parallelism)を提案した。98K H100 GPU の実クラスタで、障害復旧によるスタール時間を10分から3分へ、有効訓練時間を44%から80%へ改善したと報告する。同論文は 32K GPU 本番データの障害内訳(678件、78%がハードウェア起因)も公開しており、[[Meta AI Research SuperCluster]] の信頼性分析([[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]])や Llama 3 訓練クラスタ([[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]])と並ぶ、Meta の大規模訓練インフラの信頼性知見の系譜に位置づけられる。(Source: [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]]) 自社設計の CXL(Compute Express Link)メモリエキスパンダ ASIC「[[Vistara]]」を、ASIC設計・Linuxカーネル OS サポート・数百万台規模の本番フリート展開まで一気通貫で報告している([[@2026__ISCA__Vistara - Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment]])。全サーバの約40%がメモリ容量律速という自社フリートの課題に対し、TPP・TMOベースのソフトウェアスタックと組み合わせ、分散キャッシュで平均レイテンシ29%削減、分散ML推論でサーバ台数最大25%削減などの成果を ISCA 2026 で公開した。筆頭著者は [[Neha Gholkar]]、共著者に [[Chunqiang Tang]] も名を連ねる。(Source: [[@2026__ISCA__Vistara - Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment]]) IMC 2025 では、分散AI訓練専用の大規模RDMAデータセンターにおける本番輻輳パターンを、トポロジ層・時間スケール・ワークロードを横断して初めて測定した([[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]])。ToRスイッチの`switchos`(分単位カウンタ)とホスト常駐の`finecounters`(ミリ秒級サンプリング)を用い、PFC(Priority Flow Control)の導入によって輻輳箇所がTCP/IPデータセンターのエッジからネットワークコア(ToR→spine)へシフトしたこと、トラフィックがラックローカルでないこと(コア/エッジ差約16%)、AI訓練トラフィックがゾーンによっては53%のホストで同期する頻発バーストを示すことを報告した。[[Soudeh Ghorbani]]([[Johns Hopkins University]]兼任)を筆頭著者に、[[Yimeng Zhao]]・[[Srikanth Sundaresan]]・[[Ying Zhang]]・[[Yijing Zeng]]・[[Abhigyan Sharma]]・[[Prashanth Kannan]]・[[Cristian Lumezanu]]が共著者。(Source: [[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]]) NAIC '26(ACM SIGCOMM Workshop on Networks for AI Computing)では、AI訓練ジョブ失敗の5〜20%を占めるという、NICドライバのカーネルバグをeBPFで診断するフレームワーク RDMATracer を公開した([[@2026__NAIC__RDMATracer - A scalable eBPF-based framework for tracing RDMA syscalls]])。RDMA verbs名前空間上の4つの操作者由来ヒューリスティックで13個のkernel hookへ計装対象を絞り込み(全RDMA関数追跡比で約6桁のオーバーヘッド削減)、per-CPUカウンタとリングバッファの二重BPFマップでバースト時のgraceful degradationを実現する。本番数年間の運用で10億件超のsyscall失敗を捕捉し、独立分類器ALPS基準で73%のGPU時間浪費カバレッジを検証した。筆頭著者 Prankur Gupta のほか Miao Xu・Maxim Samoylov・[[Prashanth Kannan]]・Rajiv Krishnamurthy が Meta 所属、Theophilus A. Benson が [[Carnegie Mellon University]] 所属として参加。(Source: [[@2026__NAIC__RDMATracer - A scalable eBPF-based framework for tracing RDMA syscalls]]) ACM SIGCOMM 2024 では、ホストネットワーキング向け eBPF オーケストレーション基盤 [[NetEdit]] を公開した([[@2024__SIGCOMM__NetEdit - An Orchestration Platform for eBPF Network Functions at Scale]])。BPFAdapter によるフック点統一、pinning/bpf-iter による高可用性、Twine 連動の PolicyEngine を備え、本番 5 年以上・13 の tuningFeature を運用する。無効化実験では再送 4.5 倍・ToR ダウンリンク輻輳破棄 363.7% 増を観測した。筆頭著者は [[Theophilus A. Benson]]([[Carnegie Mellon University]])、その他は Meta 所属。RDMATracer はこの基盤経由でデプロイされる。(Source: [[@2024__SIGCOMM__NetEdit - An Orchestration Platform for eBPF Network Functions at Scale]]) [[Omar Baldonado]] は SIGCOMM 2026 の講演で、Meta のギガワット級 AI フリートを支えるネットワークをスケールアップ、スケールアウト、スケールアクロスの三領域として説明した。公式概要は、これらを個別の技術選択ではなく、モデル用途・アクセラレータ・ネットワーク機器・トポロジ・配置場所を横断する協調設計問題として扱う。性能最適化だけでなく、技術・容量移行の容易化と柔軟性を同時に目標とし、運用では障害リンクの迂回、無停止更新、長時間訓練ジョブを止めない物理交換までを設計要件に含める。(Source: [[@2026__SIGCOMM__Networking for Meta's Gigawatt-scale AI fleet]], [Hot Interconnects 2026 講演ページ](https://hoti.org/2026/keynotes-omar.html)) 技術インフラの信頼性だけでなく、その担い手であるエンジニアの組織文化も測定対象にしている。Reliability Engineering チームは人類学者 [[Kathryn Bouskill]] を起用し、40人超のインタビューと4波のサーベイで「move fast and break things」から「move fast with stable infrastructure」への文化転換の現場認識を体系的に測定した。回答者の78%がチームは信頼性を重視すると回答した一方、約半数が取り組むべき信頼性ギャップの見極めに苦労すると答え、この知見は開発者評価基準への信頼性の明示的組み込みと信頼性プログラム成熟度モデルの新設に接続された。(Source: [[@2024__SREcon24Americas__Measuring Reliability Culture to Optimize Tradeoffs]]) ## 関連 - ソース: [[@2023__SystemAtScale__AI Observability]] / [[@2024__EngineeringAtMeta__Logarithm - A logging engine for AI training workflows and services]] / [[@2025__arXiv__Collective Communication for 100k+ GPUs]] / [[@2026__SIGCOMM__Connecting 100K+ GPUs - Building the Communication Stack for Large-Scale LLM Training]] / [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]] / [[@2025__HPCA__Revisiting Reliability in Large-Scale Machine Learning Research Clusters]] / [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]] / [[@2023__arXiv__Rail-only - A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters]] / [[@2026__MLSys2026__Cost-aware Duration Prediction for Software Upgrades in Datacenters]] / [[@2026__MLSys2026__Optimizing Deployment Configurations for LLM Inference]] / [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]] / [[@2026__ISCA__Vistara - Making CXL Real—Full Path from ASIC Design and OS Support to Hyperscale Deployment]] / [[@2025__IMC__Congestion Patterns in a Large-scale RDMA Datacenter]] - 概念: [[集合通信]] / [[LLM分散学習]] / [[オープンネットワーキング]] / [[GPUクラスタ運用]] / [[耐障害LLM訓練]] / [[RDMA]] / [[Fat-Tree]] / [[GPU観測性]] / [[ソフトウェアアップグレードスケジューリング]] / [[Prefill-Decode分離]] / [[Mixture-of-Experts]] / [[並列化戦略]] / [[LLM推論設計空間探索]] / [[CXLによるメモリ拡張]] / [[データセンター輻輳制御]] / [[RDMAネットワーク監視]] / [[AI訓練ログデバッグ]] - エンティティ: [[Valentin Andrei]] / [[Dynolog]] / [[LibAsicMon]] / [[Kineto]] / [[James Hongyi Zeng]] / [[Adithya Gangidi]] / [[Rui Miao]] / [[Meta AI Research SuperCluster]] / [[Kayvon Shakeri]] / [[Ying Zhang]] / [[Naader Hasani]] / [[Omkar Salpekar]] / [[Rohan Varma]] / [[Chunqiang Tang]] / [[Maxim Naumov]] / [[FT-HSDP]] / [[Vistara]] / [[Neha Gholkar]] / [[Soudeh Ghorbani]] / [[Yimeng Zhao]] / [[Srikanth Sundaresan]] / [[Yijing Zeng]] / [[Abhigyan Sharma]] / [[Prashanth Kannan]] / [[Cristian Lumezanu]] / [[Logarithm]] / [[Omar Baldonado]] / [[Kathryn Bouskill]]