> [!contradiction] 同名の「Platform-X」が 2 つ存在する。(1) 本ページ初出の Huawei Cloud 匿名プラットフォーム([[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]])と、(2) Microsoft 社内 DL プラットフォーム([[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]])は、同じ名称だが別の組織・別のシステムである。以下は(1)の説明。Microsoft 側の Platform-X の詳細は [[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]] を参照。
## Huawei Cloud 版 Platform-X
[[Huawei Cloud]] が運営する本番のマルチテナント LLM 訓練/開発プラットフォーム(論文では Company-X が運営する匿名のプラットフォームとして扱われる)。数百の内部ユーザ・パートナー企業に LLM 訓練サービスを提供する。(Source: [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]])
- [[L4]](FSE 2025)と [[LLMPrism]](DSN 2025)双方のデプロイ先。L4 は 2024 年 6 月から障害管理システムに、LLMPrism は 2024 年 10 月から稼働する。
- テナントはプライバシー配慮でジョブ構成(マシン数・並列化戦略)を提供者と共有せず、提供者から見るとジョブはブラックボックスとなる。この制約が、ネットワークフローからの逆推定([[LLMPrism]])やログ解析([[L4]])という非侵入手法を要請する背景になっている。
- アーキテクチャは Amazon SageMaker・Google Vertex AI 等の主要プラットフォームと類似し、対象ジョブも LLaMA/Vicuna 系などの多様なオープンソースモデルを含む。
## Microsoft 版 Platform-X
[[Microsoft Research]] が社内 DL プラットフォームとして運営するシステム(ICSE 2024 の論文では "Platform-X" と明示)。Kubernetes + Docker + RDMA ネットワーク + NVIDIA DCGM で構成され、商用クラウドの DL プラットフォーム(Azure ML・SageMaker・Vertex AI)と類似する標準的な DL ツールチェーンを採用する。GPU 利用率低下の実証研究の対象となった(Source: [[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]])。
## 関連
- ソース: [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]] / [[@2025__DSN__LLMPrism - Black-box Performance Diagnosis for Production LLM Training Platforms]] / [[@2024__ICSE__An Empirical Study on Low GPU Utilization of Deep Learning Jobs]]
- 運営(Huawei 版): [[Huawei Cloud]]
- 運営(Microsoft 版): [[Microsoft Research]]
- デプロイされた診断系(Huawei 版): [[L4]] / [[LLMPrism]]
- 概念: [[LLM学習モニタリング]] / [[ログ解析]] / [[LLM分散学習]] / [[GPUクラスタ運用]]