# Efficient Training of Large Language Models on Distributed Infrastructures ## 概要 Jiangfei Duan・Shuo Zhang・Zerui Wang ほか(Shanghai AI Laboratory / CUHK / Fudan University / Shanghai Jiao Tong University / Nanyang Technological University / Peking University)によるサーベイ。**LLM 訓練を「インフラ → 並列化 → 最適化 → 耐障害性」という層で縦断する**構成を取り、スケーラビリティ・効率・信頼性の 3 観点から整理する。**長期にわたる訓練期間の信頼性維持を独立した章として扱う**点が、推論側のサーベイと分かれる特徴である。 > [!abstract] 概要(abstract の日本語訳) > GPT や LLaMA のような大規模言語モデル(LLM)は、その洗練された能力で AI 産業を変革しつつある。これらのモデルの訓練は膨大な GPU クラスタと多大な計算時間を要し、scalability・efficiency・reliability の観点で大きな課題を突きつける。本サーベイは LLM 向け訓練システムの近年の進展を概観し、AI アクセラレータ・ネットワーキング・ストレージ・スケジューリングによる訓練インフラの革新を含めて扱う。加えて、分散 LLM 訓練における並列化戦略、ならびに computation・communication・memory の最適化を取り上げる。さらに、長期にわたる訓練期間でシステムの reliability を維持するアプローチも含む。現在の革新と将来の方向性を検討することで、本サーベイは LLM 訓練システムの改善と継続的な課題への取り組みに資する有用な知見を提供することを目指す。さらに、従来のデジタル回路ベースの計算システムは LLM の計算需要を満たすうえで重大な制約に直面しており、optical computing や optical network のような革新的解決策の必要性が浮き彫りになっている。 ## 書誌情報 - 著者: Jiangfei Duan, Shuo Zhang, Zerui Wang(以上 equal contribution), Lijuan Jiang, Wenwen Qu, Qinghao Hu, Guoteng Wang, Qizhen Weng, Hang Yan, Xingcheng Zhang, Xipeng Qiu, Dahua Lin, Yonggang Wen, Xin Jin, Tianwei Zhang, Peng Sun(corresponding) - 主所属: [[Shanghai AI Laboratory]]。CUHK・Fudan University・Shanghai Jiao Tong University・Nanyang Technological University・[[Peking University]] が共同 - 媒体: arXiv:2407.20018(2024-07-29 投稿)。正式出版は Vicinagearth(Springer)Vol.3, Issue 1, Article 38、2026-06-01、DOI: 10.1007/s44336-026-00038-z - URL: https://arxiv.org/abs/2407.20018 - 構成: 全 9 章(42 PDF ページ) - 原本: `.raw/theses/arxiv-2407.20018/` ## 構成と主要テーマ 全 9 章は、課題設定(第 1〜2 章)・**インフラ**(第 3 章)・**並列化**(第 4 章)・**3 つの最適化**(第 5〜7 章)・**耐障害性**(第 8 章)・展望(第 9 章)という層で縦断する。第 1 章が立てる **SER**(Scalability・Efficiency・Reliability)の 3 課題が、そのまま以降の章割りの根拠になっている。 - **第 1〜2 章(課題設定)**: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 1 Introduction]] が SER の 3 課題を提示し、LLaMA-3 の事前学習が H100-80GB を 16,000 基使って約 54 日を要した事実を基準点に置く。[[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 2 Background]] は LLM 訓練ワークロードを従来の深層学習と分ける 4 特性——**アーキテクチャの均質性**・前例のない規模と期間・専用ソフトウェア最適化・自己教師あり訓練——を挙げ、**均質性こそがシステム最適化の余地を生む**と論じる。 - **第 3 章(インフラ)**: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 3 Infrastructure for LLM Training]]。AI アクセラレータ・ネットワーク・ストレージ・スケジューリングの 4 層。**ネットワークトラフィックが少数の elephant flow に特徴づけられ、従来の ECMP では均等分散できない**という診断から、rail-only トポロジのような設計が導かれる。 - **第 4 章(並列化)**: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 4 Parallelism Schemes for LLM Training]]。Hybrid(data / tensor / pipeline / sequence / expert の 5 次元を手で組む)・Auto(探索空間定義 → 性能モデル → 最適化アルゴリズムの 3 段階)・Heterogeneous(異種ハードウェアと異種モデル)の 3 系統。 - **第 5〜7 章(3 つの最適化)**: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 5 Computation Optimizations]] が演算子最適化と混合精度、[[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 6 Memory Optimizations]] がアクティベーション再計算・冗長性削減・断片化解消・オフロードの 4 系統、[[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 7 Communication Optimizations]] が集団通信・通信スケジューリング・インネットワーク集約の 3 系統を扱う。 - **第 8〜9 章(信頼性と展望)**: [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 8 Fault Tolerance]] が障害分析・異常検知・チェックポイント有無の復旧を扱い、[[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey - Chapter 9 Conclusion and Outlooks]] が**デジタル回路の物理的・経済的限界**と、シリコンフォトニクスによる光電子集積という展望を置く。 ## 位置づけと影響 - **「訓練を止めないこと」を独立した章として立てる**のが本サーベイの構成上の特徴である。推論側のサーベイ([[A Survey on Efficient Inference for Large Language Models]]・[[Towards Efficient Generative Large Language Model Serving]])には対応する章がない。数週間から数ヶ月続く訓練では、障害対応そのものが効率の主要な決定要因になるためである。 - **第 8 章の実測統計がその主張を数字で支える**。Meta の LLaMA3 は 16,384 GPU・54 日間の事前学習中に **466 回のジョブ中断**を経験し、その **78% がハードウェア起因**だった。ByteDance の MegaScale は 12,288 GPU で数週間に 100 回超の障害を経験した。Alibaba の**単一ノードあたり日次 1.5% という一見低い障害率は、1,000 GPU 規模では日次 84.8% に達する**。極めつけは Meta の OPT-175B で、**MFU から見積もった理想の訓練期間 25 日に対し実際は 57 日を要し、全体の 56% が障害対応に費やされた**。 - **効率の指標 MFU が規模とともに落ちる**。PTD-P が達成した MFU 52% に対し、5 倍の GPU 規模で訓練された LLaMA3 は MFU 38〜41% にとどまる。この差が縮まるのか、規模に対する構造的な代償なのかは本サーベイからは決まらない([[LLM分散学習]] に未解決の問いとして記録した)。 - **通信が階層構造を持つ**という観察が設計の前提になっている。GPT/OPT-175B の実測では **GPU ペアの 99% が一切トラフィックを持たず、0.25% 未満のペア**がパイプライン/テンソル並列とデータ並列のトラフィックを担う。InternLM-2 の 128 GPU 訓練のヒートマップも、通信の大半がノード内に閉じることを示す。この疎さが rail-only トポロジやインネットワーク集約の根拠になる。 - **vault との接続**: [[GPUレジリエンス]] に、C4 の「エラーの 82.5% がノード/デバイスに局在する」という観察と既存ノートの HeaRank のホストレベル集中を突き合わせて記録した。[[テンソル並列]] には、**アテンションヘッド数がテンソル並列とシーケンス並列(DeepSpeed-Ulysses)の双方に共通する離散的な並列度の上限**として現れる点を記録した。[[混合精度訓練]] には、FP8 未満では安定化の手法が「精度の分離」から Hadamard 変換や三値量子化のような**値分布の変換**へ移る流れを記録した。 - **限界**: 本サーベイは網羅的な整理であり、手法間の定量比較は行わない。引用する実測統計はいずれも個別システムの報告であり、条件を揃えた比較ではない。 ## 関連 - 概念: [[LLM分散学習]] / [[並列化戦略]] / [[テンソル並列]] / [[Mixture-of-Experts]] / [[条件付き計算]] / [[負荷分散]] / [[テレメトリ]] / [[Fault Localization]] ## 出典 - Jiangfei Duan et al., "Efficient Training of Large Language Models on Distributed Infrastructures: A Survey", Vicinagearth 3(1):38, 2026(arXiv:2407.20018, 2024).