# Alibaba Cloud
[[Alibaba Group]] の傘下クラウド事業部門。IaaS・PaaS 双方を世界規模で提供し、中国最大のクラウドプロバイダー。
## AIOps・オブザーバビリティ研究
- UModel の本番展開先であり共同開発者。[[Changhua Pei]]・[[Gaogang Xie]] ら CNIC/CAS・UCAS グループと Qi Zhou・Fang Situ・Cheng Zhang ら Alibaba 側メンバーが共同で [[UModel]] を設計した。1 年以上にわたる本番展開で数万ユーザー・毎秒数百万オペレーション・サブ秒クエリを達成。Container Services・APM・DevOps・実ユーザー監視・合成監視・ログサービス・クラウド監視を含む数百クラウドプロダクトをカバー。(Source: [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]])
## LLM 訓練向けネットワークインフラ
- [[Alibaba HPN]](SIGCOMM 2024、[[Kun Qian]] ほか): LLM 訓練専用の 2 層デュアルプレーンデータセンターネットワーク。非スタック型デュアル ToR + レール最適化トポロジで 1 Pod 内に 15K GPU を収容。8 ヶ月本番運用で DCN+ 比訓練スループット +14.9% を達成。(Source: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]])
## クラウドインフラ障害診断研究
- BSODiag([[Tao Duan]]・[[Pinghui Wang]]・[[Junzhou Zhao]]、[[Xi'an Jiaotong University]] と共同): 大規模クラウドインフラのバッチサーバー障害診断フレームワーク。Alibaba Cloud インフラシステムの実データ(2022〜2023 年、95 アウタージケース)で PR@3 87.5%・PCR 46.3% を達成。Alibaba Innovative Research(AIR) プログラムの支援を受けた共同研究。(Source: [[@2025__arXiv__BSODiag - A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems]])
## ネットワーク監視・障害分析研究
- SkyNet([[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures|Yang+ SIGCOMM2025]])で、89 DC × 29 リージョン × O(10⁵) ネットワークデバイス規模で 1.5 年安定稼働するネットワーク障害分析システムをデプロイ。12 種の監視データソースを統合し、severe network failure の mitigation time 中央値を 736s → 147s(80% 削減)、最大値を 14,028s → 1,920s(86% 削減)に短縮。LLM は context size 制約とハルシネーション耐性で severe failure には不採用とした上で、SkyNet 出力を LLM への入力にする posterior integration を今後課題とする。([[Ennan Zhai]]・[[Tao Lin (Alibaba)]] が corresponding author)
## 時系列異常検知研究
- RefinedEdge 論文([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], IEEE TSC 2025)の共著者として、Private Cloud Department ゼネラルマネージャー [[Guohua Liu]] が参加。[[Nankai University]] の [[Shenglin Zhang]] グループ・[[Microsoft]] の [[Minghua Ma]]・[[Tsinghua University]] の [[Dan Pei]] との産学連携で、多変量時系列異常検知(MTSAD)モデルをエッジ配備可能な水準まで圧縮する知識強化フレームワーク [[RefinedEdge]] を開発した。UModel(オブザーバビリティデータモデリング)・BSODiag(バッチサーバー障害診断)に続き、Alibaba Cloud が関与する AIOps 研究に「エッジクラウド協調型時系列異常検知」という技術領域が加わった。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]])
## 関連
- ソース: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]] / [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures]] / [[@2025__arXiv__BSODiag - A Global Diagnosis Framework for Batch Servers Outage in Large-scale Cloud Infrastructure Systems]]
- 親組織: [[Alibaba Group]]
- 関連研究者: [[Changhua Pei]] / [[Gaogang Xie]] / [[Dan Pei]] / [[Ennan Zhai]] / [[Bo Yang]] / [[Huanwu Hu]] / [[Yifan Li]] / [[Guohua Liu]]
- 関連プロダクト: [[UModel]] / [[U-SPL]] / [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures|SkyNet]] / [[Alibaba HPN]] / [[RefinedEdge]]
- 概念: [[オブザーバビリティデータモデル]] / [[AIOps]] / [[ネットワーク監視]] / [[アラート集約]] / [[異常検知]] / [[モデル圧縮]] / [[Edge-cloud Collaboration]]