# Alibaba Group
中国の IT 企業。本番クラスタのマイクロサービストレースを公開し([[@2021__SoCC__Characterizing Microservice Dependency and Performance]]、SoCC 2021)、大規模クラウド研究の基盤データを提供している(Alibaba Cluster Trace Program: https://github.com/alibaba/clusterdata)。Guoyao Xu・Liping Zhang・Yu Ding・Jian He らが SIAT/Macau 大学チームと共同で 20,000 超マイクロサービスの特性解析に参画した。[[MicroRemed]] では [[Peking University]] と共同で著者を出す(Yunpeng Zhai・Zhaoyang Liu・Bolin Ding ら)。同ベンチマークで最良性能を示す Qwen3 シリーズ(Qwen3-Plus/Max/Flash 等)の開発元でもある。
- 大規模 AI 訓練インフラの研究も担う。[[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]](HPCA 2025)では [[Hong Kong University of Science and Technology]] と共同で、リアルタイム異常検知・通信最適化システム [[C4]]([[C4D]]/[[C4P]])と集約通信ライブラリ [[ACCL]] を開発した。
- クラウド事業者(Alibaba Cloud)として LLM 訓練の障害・ネットワーク信頼性の本番システムを多数生む。[[SkeletonHunter]]([[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]], SIGCOMM 2025)はコンテナネットワーク障害診断、[[Aegis]]([[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]], NSDI 2025、責任著者 [[Ennan Zhai]])は CCL カスタマイズによる障害診断システムで、いずれも Alibaba Cloud の本番 AI 訓練クラウドで運用される。
- [[XPUTimer]](Flare、[[@2025__arXiv__XPUTimer - Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Scale]])は [[Ant Group]] が本番運用する異常診断フレームワークで、Alibaba 系のエコシステムに連なる(著者の主たる所属は [[Shanghai Jiao Tong University]]・[[National University of Singapore]]・Ant Group)。
- [[Mint]]([[@2025__ASPLOS__Mint - Cost-Efficient Tracing with All Requests Collection via Commonality and Variability Analysis]], ASPLOS 2025)では Cheng Chen・Kunyi Chen・Huxing Zhang・Qi Zhou が Alibaba 側として参加。Alibaba のトレーシングシステムで日量 18.6〜20.5 PB のデータが生成される環境を対象に、[[Sun Yat-sen University]] と共同で「共通性 + 可変性」パラダイムによるコスト効率的なトレーシングフレームワークを開発し、本番 2 か月以上デプロイした。
- [[Alibaba PAI]](Platform for Artificial Intelligence)は Alibaba Cloud の MLaaS プラットフォーム。[[@2022__NSDI__MLaaS in the Wild - Workload Analysis and Scheduling in Large-Scale Heterogeneous GPU Clusters]](NSDI 2022)では 6,742 GPU 本番クラスタから取得した 2 か月分のトレースを解析し、異種混合 GPU クラスタにおける訓練・推論混在ワークロードの特性とスケジューリング課題を体系化した。GPU 共有と予約+パッキング方針の本番導入効果(平均 GPU 台数 50% 削減、高 GPU タスク待ち時間 68% 削減)を定量化している。[[Qizhen Weng]]([[Hong Kong University of Science and Technology]])・[[Wencong Xiao]] らが著者。
- [[Lindorm TSDB]]([[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]], PVLDB 2023)は Alibaba Group が開発・運用するクラウドネイティブ分散時系列データベース。大規模監視システム(1 秒あたり最大 3.5 億データ点、10 億超時系列)を支えるインフラであり、共有なし + 共有ストレージのハイブリッドアーキテクチャ、インデータベース ML(Lindorm ML)を特徴とする。[[Dan Pei]]([[Tsinghua University]])・[[Feifei Li]] らとの産学共同研究。InfluxDB・TimescaleDB 比で書き込みスループット最大 10 倍、クエリレイテンシ最大 16 倍の改善を実証。
- [[Tongyi Lab]] が開発した [[AutoForge]]([[@2025__arXiv__AutoForge - Environment Synthesis for Agentic RL]])は、ツール記述文書から模擬環境を自動合成しエージェント型 RL(ERPO)で言語エージェントを訓練するフレームワーク。Qwen3-30B-A3B(活性 3B)で 200B 未満オープンソース最良を達成。
- [[Unicron]]([[@2024__arXiv__Unicron - Economizing Self-Healing LLM Training at Scale]], arXiv 2024)は Alibaba Group が Alibaba Cloud 上で開発・評価した LLM 訓練向け自己修復ワークロードマネージャ。[[Megatron-LM]] を基盤とし、インバンド誤り検知・コスト認識プラン生成・効率的遷移戦略の三機構で、128 GPU クラスタにて Megatron 比 1.9×(高頻度障害トレース)の累積 WAF 改善を実証した。[[Tao He (Alibaba)]]・Xue Li・[[Kun Qian]]・[[Jingren Zhou]] らが著者。
- GOC(Global Operations Center)は中国 2 拠点(杭州・北京)と米国 1 拠点で 7×24 時間のモニタリングサービスを提供し、全事業部にまたがる主要障害の 90% を発見する。[[Ren Xinchi]] が SREcon18 Asia/Australia で紹介した 4 層モニタリング構造(インフラストラクチャ → システム/アプリケーション → ビジネス → 顧客フィードバック)は、ビジネスレイヤの KPI(5 ゴールデンエレメント: 総数・成功数・成功率・応答時間・失敗数)を最重要と位置づけ、CMDB [[Hammurabi]] でビジネス機能と優先度をマッピングする([[@2018__SREcon18 Asia__Introduction to Alibaba Monitoring System]])。
- 同じ GOC チームの [[Zhaogang Wang]] は SREcon17 Asia/Australia([[@2017__SREcon17 Asia__Smart Monitoring System for Anomaly Detection on Business Trends in Alibaba]])で、ビジネストレンド時系列への異常検知スマート監視システムを発表した。STL(Seasonal Trend LOESS)をベースに、ノイズ除去・平滑化・未来補完・再平滑化の 4 段階カスタム前処理 + 時間セグメント × ビジネストレンドごとの適応 N-シグマ閾値 + オペレータラベルによる閉ループフィードバックを組み合わせ、適合率・再現率ともに 80% を達成した。
- [[LagRCA]] 論文([[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]], FSE Companion '26)は [[Wei Li]]・[[Liping Zhang]] が Alibaba Group から参加し、[[Nankai University]]・[[Tsinghua University]] との共同研究で提案された遅延認識時空間因果推論フレームワーク。Alibaba の観測プラットフォームに 3 ヶ月間本番デプロイし、アラートから根本原因ランキングまでのエンドツーエンドレイテンシを 0.9 秒未満に短縮、事後検証 AC@5 80%超を達成した。(Source: [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]])
- OScope 論文([[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]], ICSE-SEIP '26)は [[Luping Wang]]・[[Li Shi]]・[[Cheng Huang]]・[[Guodong Yang]]・[[Liping Zhang]] が Alibaba Group から参加し、[[Nankai University]]([[Yongxin Zhao]] 筆頭・[[Shenglin Zhang]] 責任著者)・[[Tsinghua University]]([[Dan Pei]])との共同で、OS 障害診断向け LLM フレームワーク [[OScope]] を開発した。マイクロサービス RCA([[LagRCA]])に続く Alibaba 側の産学連携で、対象は OS レベル障害診断に及ぶ。Alibaba 本番 101 件の OS 障害データセットで AC@5=0.901 を達成し、Foresight O&M システムへ統合、3 ヶ月間・3 チームへのデプロイで平均診断時間を約 112 分から約 1.5 分へ短縮した。(Source: [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]])
## 関連
- 本ソース: [[@2021__SoCC__Characterizing Microservice Dependency and Performance]] / [[@2025__arXiv__MicroRemed - Benchmarking LLMs in Microservices Remediation]] / [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]] / [[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]] / [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]] / [[@2025__arXiv__XPUTimer - Anomaly Diagnostics for Divergent LLM Training in GPU Clusters of Thousand-Plus Large Scale]] / [[@2025__ASPLOS__Mint - Cost-Efficient Tracing with All Requests Collection via Commonality and Variability Analysis]] / [[@2025__arXiv__AutoForge - Environment Synthesis for Agentic RL]] / [[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]] / [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]] / [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]]
- 共同研究: [[Peking University]] / [[Hong Kong University of Science and Technology]] / [[Tsinghua University]] / [[University of Illinois Urbana-Champaign]] / [[Sun Yat-sen University]]
- 関連システム: [[C4]] / [[ACCL]] / [[SkeletonHunter]] / [[Aegis]] / [[Alibaba HPN]] / [[Mint]] / [[AutoForge]] / [[Hammurabi]]
- 関連組織: [[Ant Group]] / [[Tongyi Lab]]
- 関連システム: [[C4]] / [[ACCL]] / [[SkeletonHunter]] / [[Aegis]] / [[Alibaba HPN]] / [[Mint]] / [[AutoForge]] / [[Hammurabi]] / [[Unicron]] / [[OScope]]
- 関連概念: [[AIOps]] / [[障害緩和]] / [[耐障害LLM訓練]] / [[Fault Localization]] / [[RDMAネットワーク監視]] / [[分散トレーシング]] / [[エージェント型強化学習]] / [[ビジネスモニタリング]] / [[TSG自動化]]