# Microsoft [[AIOpsLab]]([[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]])の主要所属(Redmond, USA)。本ソースの 9 著者のうち Gagan Somashekar・[[Minghua Ma]]・Jonathan Mace・Chetan Bansal・Rujia Wang・Saravan Rajmohan の 6 名が Microsoft 所属。 - クラウドのインシデント管理・AIOps の研究を継続的に展開しており、AIOpsLab はその一環として大学(UIUC・UC Berkeley・IISc)と共同で開発された。 - [[Philly]] 論文([[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]])では、[[Microsoft]] Research が社内のマルチテナント GPU 訓練クラスタの 75 日・96,260 ジョブのトレースを分析し、GPU スケジューリング・局所性・失敗原因を定量化した。AIOps/インシデント研究以前から、機械学習インフラ運用の本番トレースを公開していた系譜として接続する。 - [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]](ICSE 2026)では Azure OpenAI を含む GenAI クラウドサービスの本番インシデント 4 年分のデータを提供。著者 13 名中 8 名が Microsoft 所属(USA 6 名 + China 3 名)で、AIOps 研究群の中核拠点としての位置付けがより鮮明になった。 - AIOps/インシデント管理だけでなく、クラウド構成の信頼性研究にも関与。[[Zodiac]]([[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]], SOSP '24)では [[Ryan Beckett]] が唯一の Microsoft 側著者として、[[University of Michigan]] と共同で [[Microsoft Azure]] / [[Terraform]] のセマンティックチェック発掘を担った。AIOps(本番診断)と構成検証(デプロイ前防止)の両面でクラウド信頼性に投資している構図。 - [[OpenRCA]] 論文([[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]], ICLR 2025)の主要所属の一つ。10 著者中 [[Shilin He]]・[[Chaoyun Zhang]]・[[Qingwei Lin]]・Dongmei Zhang・Qi Zhang の 5 名が Microsoft 所属で、筆頭 [[Junjielong Xu]] も Microsoft DKI でのインターン中に実施した。AIOps 研究の延長として LLM の RCA 能力ベンチマーク化を担った。(Source: [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]]) - [[@2007__LISA__On Designing and Deploying Internet-Scale Services]](LISA '07)では、[[James Hamilton]] が Windows Live Services Platform のアーキテクトとして、MSN・Windows Live Search・Windows Live Mail・Exchange Hosted Services・Xbox Live 等の大規模サービス運用から蓄積した 20 年以上のベストプラクティスを体系化した。一部のサービスは 2.5 億ユーザ超に成長しており、インターネットスケールサービスの設計・運用知の成文化における先駆的論文である。Microsoft のクラウド運用研究の最も初期の系譜に位置づけられる。 - [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]](arXiv:2605.23348v1、2026-05-22)では、[[Debopam Bhattacherjee]] ら 10 名の Microsoft 研究者が [[AI Greenferencing]](風力発電サイトに GPU を配置する展開モデル)と [[XWind]](可変電力下での LLM 推論クロスサイトルーター)を提案。AI インフラのサステナビリティを電力源から再設計するアプローチで、Azure データセンターから 50ms RTT 以内に 890 GW 超の風力容量が存在するという実現可能性分析を示した。 - [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]](IEEE CAI 2026)では、[[Vaishali Vinay]] が Microsoft Security Research 所属として、LLM アプリケーションの失敗を推論・入力/コンテキスト・システム/運用の 3 層 15 種に分類した。Microsoft の GenAI 信頼性研究は、Azure OpenAI の本番インシデント分析、エージェント評価・運用自動化、AI インフラ設計に加えて、アプリケーション設計時の失敗モード整理にも広がっている。(Source: [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]]) - [[@2023__NSDI__Empowering Azure Storage with RDMA]](NSDI 2023)では、[[Wei Bai]] ら Microsoft の大規模著者群が、[[Azure Storage]] のフロントエンド/バックエンド通信を [[RDMA]] 化し、リージョン内規模で全 Azure パブリックリージョンに展開した経験を報告した。Microsoft のクラウド信頼性研究は AIOps/LLM 運用だけでなく、ストレージ・ネットワーク基盤の本番プロトコル設計と運用にも強い一次情報を持つ。 - [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]](ASE 2020)では、[[Qingwei Lin]] が対応著者として 18 Microsoft オンラインサービスの 6 か月分インシデントを分析し、incidental incidents が平均 50.32%・TTR の 55.05% を消費するという「半数以上が無視してよい」構造を初めて定量化。著者 11 名のうち 8 名が Microsoft(Research Beijing 5 + Azure Redmond 3)所属で、Microsoft の AIOps 研究系譜の早期論文。 - [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]](SIGCOMM 2016)では、[[Chuanxiong Guo]]・[[Haitao Wu]]・Zhong Deng・Gaurav Soni・Jianxi Ye・[[Jitendra Padhye]]・Marina Lipshteyn の全 7 名が Microsoft 所属として、RoCEv2 の大規模本番展開における DSCP-based PFC 設計・4 大安全課題(デッドロック/ライブロック/NIC PFC ストーム/スローレシーバー症状)の発見と解決・RDMA Pingmesh を報告した。この論文は後の [[@2023__NSDI__Empowering Azure Storage with RDMA]] や [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]] につながる Microsoft の RDMA 研究系譜の出発点に位置づけられる。 - [[@2025__ICLR__SCBench - A KV Cache-Centric Analysis of Long-Context Methods]](ICLR 2025)では、[[Huiqiang Jiang]](責任著者)ら Microsoft 研究グループが [[University of Surrey]] の [[Yucheng Li]] と共同で [[SCBench]] を提案。KV キャッシュのライフサイクル全体(生成・圧縮・検索・ローディング)を評価する初の包括的ベンチマークを構築し、8 カテゴリ・13 手法・8 LLM を評価した。sub-O(n) メモリ手法はマルチターン設定で実質破綻すること、動的スパース・アテンション(MInference)が最も堅牢であることを示した。 COMET([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]、ISSRE 2024)を2つの大規模クラウドサービスに6ヶ月以上展開し、LLM キーワード抽出によるインシデントトリアージで精度(ACC@1)30%改善・TTM 35%短縮を達成した。(Source: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]) [[Chaoyun Zhang]]・[[Qingwei Lin]]([[Microsoft]] Beijing)、[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]([[Microsoft]] Redmond/Seattle)が Build-bench 論文([[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)に共著者として参加。[[Nankai University]]・[[Peking University]]・[[Tsinghua University]] とのクロス ISA(x86_64/aarch64)ビルド修復ベンチマーク開発に寄与した。(Source: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]) [[Chaoyun Zhang]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Dongmei Zhang]]・[[Saravan Rajmohan]]・[[Chetan Bansal]]・[[Minghua Ma]] が Aloha 論文([[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]、FSE Companion '26)に共著者として参加。[[Nankai University]] の [[Shenglin Zhang]](筆頭)・[[Yujia Wu]]・[[Jinghuan Ren]]・[[Wenwei Gu]]、責任著者 [[Yongqian Sun]] との共同で、対照分析ベースの異常箇所特定を human-in-the-loop エージェントでオペレーショナル化するフレームワークを提案し、Microsoft クラウドの 127 件の実バッチ障害ケースで有効性を実証した。(Source: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]) ## 関連 - ソース: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] / [[@2007__LISA__On Designing and Deploying Internet-Scale Services]] / [[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]] / [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] / [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]] / [[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]] / [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]] / [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]] / [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]] / [[@2026__Glenn K. Lockwood Blog__AI doesnt need giant supercomputers after all]] / [[@2023__NSDI__Empowering Azure Storage with RDMA]] / [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]] / [[@2025__ICLR__SCBench - A KV Cache-Centric Analysis of Long-Context Methods]] - ML インフラ: [[Philly]] / [[philly-traces]] - 所属研究者: [[James Hamilton]](Windows Live Services Platform アーキテクト、2007 年)/ [[Minghua Ma]] / [[Yinfang Chen]](インターン)/ [[Haoran Yan]](インターン)/ [[Ryan Beckett]] / [[Shilin He]] / [[Qingwei Lin]] / [[Chaoyun Zhang]] / [[Junjielong Xu]](インターン)/ [[Debopam Bhattacherjee]] / [[Vaishali Vinay]] / [[Chuanxiong Guo]](RDMA 展開主導、2015-2016 年)/ [[Haitao Wu]] / [[Jitendra Padhye]] / [[Huiqiang Jiang]](LLM 推論効率化) - 関連プロダクト: [[AIOpsLab]] / [[Microsoft Azure]] / [[Azure Storage]] / [[Zodiac]] / [[OpenRCA]] / [[XWind]] / [[Microsoft Fairwater]] / [[SCBench]] - 関連 MOC: [[AIOps - Failure Detection - MOC]] / [[LLM4SRE - MOC]] / [[Software Engineering - MOC]]