# LLM学習インフラ
## 定義
LLM学習インフラ(Large Language Model Training Infrastructure)とは、数千基から十万基規模のGPU/AIアクセラレータ、広帯域・低遅延インターコネクト(NVLink、InfiniBand、RoCE)、大容量ホストメモリ、階層化電源および直接液冷(DLC)設備、ならびにこれらを統括するクラスタオーケストレーション機構(Kubernetes、ジョブコントローラ、通信ライブラリ)から構成される、大規模言語モデルの超並列・長期分散事前学習を支える計算基盤の総体である。従来の深層学習(DL)基盤と異なり、厳格なバッチ同期並列(BSP)とハイブリッド並列(DP+TP+PP)の採用により、単一のハードウェア障害やストラグラー(遅延ワーカー)がクラスタ全体を停止・遊休化させるため、物理層から通信・並列実行層に至る包括的な信頼性設計が不可欠となる。([[@2025__TSSR__Reliability Optimization for Large Language Model Training Infrastructure]])
## 未解決の問い
- 10万GPU超の次世代超巨大クラスタにおいて、規模増大に伴い指数関数的に短縮するジョブMTTF(13万基規模で約14分)に対し、障害検知・ノード隔離・チェックポイント復旧・通信再初期化からなる一連の復旧オーバーヘッド(MTTR)を数十秒以内に圧縮し、ETTR 90%以上を維持するための統合アーキテクチャはどのように設計されるべきか?
- 一過性の計算遅延(熱スロットリングやOSジッター)と恒久的な物理劣化(光トランシーバーの断続的ビットエラーやNVLinkの性能低下)をリアルタイムに峻別し、ジョブ再起動(ノード隔離)と無停止緩和(マイクロバッチ調整・トポロジ再構成)を自動選択するクロスレイヤー信頼性協調コントローラの最適境界はどこにあるか?
## 未編纂の観察
- **[物理層からシステム層に至る縦断的最適化がLLM訓練の信頼性を決定づける]**: [[@2025__TSSR__Reliability Optimization for Large Language Model Training Infrastructure]] は、LLM訓練中断の68%が物理構造(GPU過熱、リンク輻輳、電源変動)に起因し、直接液冷(DLCによる接合部温度15〜20°C低減、熱起因障害40%削減)、リーフ・スパイン型デュアルRDMAリンク(1本故障時の帯域95%維持)、ラック単位UPS(10分間給電によるチェックポイント退避)および冗長電源(RPS)が基底の耐障害性を形成することを示した。その上で、通信認識型検知(ACCLによる10秒検知)、2段階非同期チェックポインティング(ホストCPUメモリ経由でオーバーヘッドを最大58.7倍削減)、およびトポロジ再構成・適応ルーティングによるストラグラー緩和を多層防御として連携させることが実稼働率(ETTR)最大化の鍵となる。(Source: [[@2025__TSSR__Reliability Optimization for Large Language Model Training Infrastructure]])
## 関連
- ソース: [[@2025__TSSR__Reliability Optimization for Large Language Model Training Infrastructure]]
- 概念: [[耐障害LLM訓練]], [[LLM分散学習]], [[チェックポイント]], [[ストラグラー]], [[信頼性工学]], [[集合通信]]
- エンティティ: [[wiki/entities/Yuchang Mo|Yuchang Mo]]
## 出典
- [[@2025__TSSR__Reliability Optimization for Large Language Model Training Infrastructure]](LLM訓練インフラにおける信頼性最適化の3本柱、物理層耐障害性、長期トレース分析の体系化)