# Aegis [[Alibaba Group|Alibaba Cloud]] の本番 AI モデル訓練クラウド向けの障害診断システム(Dong+)。真の一次ソースは NSDI 2025 の経験論文 "Evolution of Aegis"([[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]]、責任著者 [[Ennan Zhai]])で、設計と 2 フェーズの進化の実運用経験を共有する。当初は訓練ログとハードウェアカウンタに依拠し、後に CCL を改変して各オペレータの実行情報(start/end timestamp・スループット・work request/completion 数)を収集するよう進化した。 NSDI 2025 一次ソースの要点(Source: [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]]): - カスタム CCL が各通信オペレータ・各 GPU の launch(`CL`)/work-request(`WR`)/completion(`WC`)カウンタを記録し、**計算障害**(同グループ内で `CL` が遅れる)と**通信障害**(`WR<WC`)を弁別する。導入容易性を第一原則に、Phase-1 で既存の汎用診断システムを拡張、Phase-2 で CCL を改変して顧客コード非侵入の手順認識型診断を実現した。 - 障害診断・性能劣化診断に加え、納品前チェック(Check Before Delivery, CBD)でクラスタのライフサイクル全体をカバーする。本番に 1 年以上デプロイし、診断起因の idle time を 97% 以上、訓練タスク再起動回数を 84% 以上、性能劣化を 71% 削減した。 [[Pulse]] からは OP-level 監視の SOTA として参照される(Pulse が引く [13]、Source: [[@2026__ASPLOS__Pulse - Fine-grained and Non-intrusive LLM Training Monitoring via Microsecond-level Traffic Measurement]] §2.2)。 [[Pulse]] の比較対象(SOTA)の 1 つ。[[Holmes]]・[[GreyHound]] とともに **OP-level 監視**に分類され、オペレータの内部進行が見えずストラグラーをマシン単位に箇所特定できない、計算と通信の異常を弁別できない、という限界を Pulse に指摘される。コード計装(CCL 改変)を要する点もクラウド事業者には不向きとされる。 ## 関連 - ソース: [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]] / [[@2026__ASPLOS__Pulse - Fine-grained and Non-intrusive LLM Training Monitoring via Microsecond-level Traffic Measurement]] - 概念: [[LLM学習モニタリング]] / [[Fault Localization]] / [[集合通信]] / [[根本原因分析]] - エンティティ: [[Alibaba Group]] / [[Ennan Zhai]] / [[Pulse]] / [[Holmes]] / [[GreyHound]] / [[Minder]]