# Alibaba Cloud
[[Alibaba Group]] の傘下クラウド事業部門。IaaS・PaaS 双方を世界規模で提供し、中国最大のクラウドプロバイダー。
## ソフトウェア運用 LLM 研究
- [[OpsLLM]]([[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]], arXiv 2026)の共著者として Alibaba Cloud Computing(杭州)の [[Ye Li]]・[[Xidao Wen]]・[[Fang Situ]]・[[Qi Zhou]] が参加。[[Sun Yat-sen University]]([[Jingkai He]]・[[Pengfei Chen]] ほか)と共同で、QA と RCA を統合的にサポートするソフトウェア運用ドメイン特化 LLM を、Human-in-the-Loop データキュレーション + SFT + ドメインプロセス報酬モデル(DPRM)ベース強化学習で構築した。[[Fang Situ]]・[[Qi Zhou]] は UModel(オブザーバビリティデータモデリング)にも共著者として参加しており、Alibaba Cloud のオブザーバビリティ研究チームが複数の AIOps 関連プロジェクトに横断的に関与していることを示す。(Source: [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]])
## AIOps・オブザーバビリティ研究
- UModel の本番展開先であり共同開発者。[[Changhua Pei]]・[[Gaogang Xie]] ら CNIC/CAS・UCAS グループと Qi Zhou・Fang Situ・Cheng Zhang ら Alibaba 側メンバーが共同で [[UModel]] を設計した。1 年以上にわたる本番展開で数万ユーザー・毎秒数百万オペレーション・サブ秒クエリを達成。Container Services・APM・DevOps・実ユーザー監視・合成監視・ログサービス・クラウド監視を含む数百クラウドプロダクトをカバー。(Source: [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]])
## LLM 訓練向けネットワークインフラ
- [[Alibaba HPN]](SIGCOMM 2024、[[Kun Qian]] ほか): LLM 訓練専用の 2 層デュアルプレーンデータセンターネットワーク。非スタック型デュアル ToR + レール最適化トポロジで 1 Pod 内に 15K GPU を収容。8 ヶ月本番運用で DCN+ 比訓練スループット +14.9% を達成。(Source: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]])
## クラウドインフラ障害診断研究
- BSODiag([[Tao Duan]]・[[Pinghui Wang]]・[[Junzhou Zhao]]、[[Xi'an Jiaotong University]] と共同): 大規模クラウドインフラのバッチサーバー障害診断フレームワーク。Alibaba Cloud インフラシステムの実データ(2022〜2023 年、95 アウタージケース)で PR@3 87.5%・PCR 46.3% を達成。Alibaba Innovative Research(AIR) プログラムの支援を受けた共同研究。(Source: [[@2025__arXiv__BSODiag - A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems]])
## ネットワーク監視・障害分析研究
- SkyNet([[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures|Yang+ SIGCOMM2025]])で、89 DC × 29 リージョン × O(10⁵) ネットワークデバイス規模で 1.5 年安定稼働するネットワーク障害分析システムをデプロイ。12 種の監視データソースを統合し、severe network failure の mitigation time 中央値を 736s → 147s(80% 削減)、最大値を 14,028s → 1,920s(86% 削減)に短縮。LLM は context size 制約とハルシネーション耐性で severe failure には不採用とした上で、SkyNet 出力を LLM への入力にする posterior integration を今後課題とする。([[Ennan Zhai]]・[[Tao Lin (Alibaba)]] が corresponding author)
## 時系列異常検知研究
- RefinedEdge 論文([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], IEEE TSC 2025)の共著者として、Private Cloud Department ゼネラルマネージャー [[Guohua Liu]] が参加。[[Nankai University]] の [[Shenglin Zhang]] グループ・[[Microsoft]] の [[Minghua Ma]]・[[Tsinghua University]] の [[Dan Pei]] との産学連携で、多変量時系列異常検知(MTSAD)モデルをエッジ配備可能な水準まで圧縮する知識強化フレームワーク [[RefinedEdge]] を開発した。UModel(オブザーバビリティデータモデリング)・BSODiag(バッチサーバー障害診断)に続き、Alibaba Cloud が関与する AIOps 研究に「エッジクラウド協調型時系列異常検知」という技術領域が加わった。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]])
## AIスーパーノード・KVキャッシュ基盤(ハードウェアインフラ)
- OCTS 2026(メインフォーラム陳健)にて、CPU-GPU協調型スーパーノード基盤「磐久UMX(Unified Memory Extension)」を発表。UALink+CXLによるLoad/Storeメモリセマンティクスで、DRAM/SCM/HBF/TLC・QLC SSDをナノ秒級遅延で統一接続し、AL128スーパーノードクラスタではCPUとGPUの数量比をほぼ1:1に近づける構想を示した。エージェントの実稼働時間が1日のわずか約15%にとどまるという実測(アイドル約55%、LLM応答待ち約25%)に基づき、Agent SandboxのvCPU 4〜5倍オーバーコミットを提示。制約はCPUコア数ではなくメモリ容量であると明言した。(Source: [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]])
- CXLメモリプール化アーキテクチャ「Beluga」は、RDMAベース方式との比較で初回トークン遅延(TTFT)を89.6%削減、vLLMスループットを7.35倍向上させた。PolarDBへの適用はSIGMOD'25産業トラック最優秀論文を受賞している。(Source: [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]])
## ネットワーク機器RCA研究
- AIDA([[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]], SIGCOMM 2026): [[Sun Yat-sen University]] との共同研究として、マルチベンダーのネットワーク機器障害向け自動RCAシステム [[AIDA]] を本番ネットワークに1年以上展開。強化学習でファインチューニングしたLLMによる推論チェーン抽出とSimRankベースの知識グラフ構築、多段階RAG推論を組み合わせ、846件の障害ケースを精度95.4%で処理し、RCA所要時間の中央値を72.6時間から1.6分へ短縮した。監視によるフォルト局所化を担う BiAn([[Ennan Zhai]] が共通の corresponding author)の後段に位置づけられ、同一グループが「局所化」と「RCA」の両方を担う本番パイプラインを構成する。(Source: [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]])
## ストレージネットワークとLUNA
Alibaba Cloudのストレージ事業は、コンピュートとストレージを分離したフロントエンド/バックエンド構成を採用する。[[LUNA]]はEBS、Object Storage Service、Cloud Tablestore Serviceなどのフロントエンドネットワークへ展開されたユーザーレベルTCP/IPスタックであり、run-to-completion、[[Zbuf]]によるゼロコピー、Flow BifurcationとSR-IOVによるカーネルTCP共存を組み合わせる([[@2023__USENIX ATC__Deploying User-space TCP at Cloud Scale with LUNA]])。
## ストレージデバイスのフェイルスロー検知
- [[PERSEUS]]([[@2023__loginonline__Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems]], USENIX ;login: online 2023): ストレージデバイス(HDD/SSD)向けの非侵入的・細粒度フェイルスロー検知フレームワーク。ノード内のレイテンシ対スループット(LvT)分布への多項式回帰で適応的しきい値を自動導出し、既存手法(閾値フィルタリング・ピア評価・IASOベースモデル)を Precision 0.99・Recall 1.00・MCC 0.99 で上回る。運用開始後 25 万台超のドライブから 304 台のフェイルスロードライブを検出した。約 1000 億エントリの実測データセットを公開ベンチマークとして提供している。(Source: [[@2023__loginonline__Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems]])
## 分散訓練チェックポインティング研究
- FlowCheck([[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]], EuroSys '25): [[Shanghai Jiao Tong University]]・[[Peking University]]・[[Zhejiang University]]・[[Hangzhou Feitian Cloud]] との共同研究として、データセンタースイッチのポートミラーリング機能で DP の allreduce トラフィックを傍受し、CPU 専用チェックポイントノードでチェックポイントを更新するシステムを発表した。訓練ノード側に一切の追加通信を課さずにチェックポイントと訓練を分離する設計で、実運用の障害頻度下で98%超の有効訓練時間比率を達成した。共著者は [[Zimeng Huang]]・[[Hao Nie]]・[[Haonan Jia]]・[[Bo Jiang]]・[[Junchen Guo]]・[[Jianyuan Lu]]・[[Rong Wen]]・[[Biao Lyu]]・[[Shunmin Zhu]]・[[Xinbing Wang]]。ソフトウェア実装は [[flowcheck-eurosys25]] としてオープンソース公開。(Source: [[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]])
## 関連
- ソース: [[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]] / [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]] / [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]] / [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures]] / [[@2025__arXiv__BSODiag - A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems]] / [[@2026__SpeakerDeck__AIインフラの最新技術動向 2026 — 中国OCPコミュニティから読み解く6つの技術トレンド]] / [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]] / [[@2023__loginonline__Detecting Fail-Slow Failures in Large-Scale Cloud Storage Systems]] / [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]] / [[@2025__SIGCOMM__Alibaba Stellar - A New Generation RDMA Network for Cloud AI]] / [[@2025__NSDI__Mitigating Scalability Walls of RDMA-based Container Networks]] / [[@2026__SIGCOMM__Networked Agent Memory and Causality Representation - Experiences towards Interpretable Cloud-Scale Root-Causing]]
- 親組織: [[Alibaba Group]]
- 関連研究者: [[Changhua Pei]] / [[Gaogang Xie]] / [[Dan Pei]] / [[Ennan Zhai]] / [[Bo Yang]] / [[Huanwu Hu]] / [[Yifan Li]] / [[Guohua Liu]] / [[Ye Li]] / [[Xidao Wen]] / [[Fang Situ]] / [[Qi Zhou]] / [[Xuan Zeng]] / [[Xumiao Zhang]] / [[Yang Lv]] / [[Peng Zhang]] / [[Zimeng Huang]] / [[Hao Nie]] / [[Haonan Jia]] / [[Bo Jiang]] / [[Junchen Guo]] / [[Jianyuan Lu]] / [[Rong Wen]] / [[Biao Lyu]] / [[Shunmin Zhu]] / [[Xinbing Wang]] / [[Erci Xu]] / [[Jiesheng Wu]]
- 関連プロダクト: [[OpsLLM]] / [[UModel]] / [[U-SPL]] / [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures|SkyNet]] / [[Alibaba HPN]] / [[RefinedEdge]] / [[AIDA]] / [[flowcheck-eurosys25]] / [[PERSEUS]]
- 概念: [[オブザーバビリティデータモデル]] / [[AIOps]] / [[ネットワーク監視]] / [[アラート集約]] / [[異常検知]] / [[モデル圧縮]] / [[Edge-cloud Collaboration]] / [[AIスーパーノード]] / [[KVキャッシュ管理]] / [[LLMによる根本原因分析]] / [[検証可能報酬による強化学習]] / [[グラフベースRCA]] / [[チェックポイント]] / [[集合通信]] / [[フェイルスローハードウェア]]
- [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]](ICLR 2026)。共著者 [[Xidao Wen]] の所属先(Alibaba Cloud Computing Company, Hangzhou)として記載。(Source: [[@2026__ICLR__AutoDA-Timeseries - Automated Data Augmentation for Time Series]])