# Microsoft [[AIOpsLab]]([[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]])の主要所属(Redmond, USA)。本ソースの 9 著者のうち Gagan Somashekar・[[Minghua Ma]]・Jonathan Mace・Chetan Bansal・Rujia Wang・Saravan Rajmohan の 6 名が Microsoft 所属。 - [[Coburn Watson]](Production Infrastructure Engineering 部門パートナー、元 Netflix サイトリライアビリティ・性能エンジニアリング・クラウドインフラストラクチャ部門責任者)が、『SREの探求』1章([[@2021__OReillyJapan__SREの探求 - Chapter 1 SREにおけるコンテキストとコントロール]])で編者 David N. Blank-Edelman と対談し、Netflix 在籍時代の経験に基づき「コンテキスト駆動型モデル」対「コントロールベースモデル」という SRE 実践の対比を語った。(Source: [[@2021__OReillyJapan__SREの探求 - Chapter 1 SREにおけるコンテキストとコントロール]]) - [[Niall Murphy]](ダブリン支社、Software Engineering for Azure Production Infrastructure Engineering 部門ディレクター)が、『SREの探求』第30章「オンコール反対論」([[@2021__OReillyJapan__SREの探求 - Chapter 30 オンコール反対論]])を単独で執筆した。オンコールという慣行そのものへの反対論を展開し、根本的な解決策として業界規模で標準化されたツールキットソフトウェアの構築を提唱する。(Source: [[@2021__OReillyJapan__SREの探求 - Chapter 30 オンコール反対論]]) - クラウドのインシデント管理・AIOps の研究を継続的に展開しており、AIOpsLab はその一環として大学(UIUC・UC Berkeley・IISc)と共同で開発された。 - [[Philly]] 論文([[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]])では、[[Microsoft]] Research が社内のマルチテナント GPU 訓練クラスタの 75 日・96,260 ジョブのトレースを分析し、GPU スケジューリング・局所性・失敗原因を定量化した。AIOps/インシデント研究以前から、機械学習インフラ運用の本番トレースを公開していた系譜として接続する。 - [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]](ICSE 2026)では Azure OpenAI を含む GenAI クラウドサービスの本番インシデント 4 年分のデータを提供。著者 13 名中 8 名が Microsoft 所属(USA 6 名 + China 3 名)で、AIOps 研究群の中核拠点としての位置付けがより鮮明になった。 - AIOps/インシデント管理だけでなく、クラウド構成の信頼性研究にも関与。[[Zodiac]]([[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]], SOSP '24)では [[Ryan Beckett]] が唯一の Microsoft 側著者として、[[University of Michigan]] と共同で [[Microsoft Azure]] / [[Terraform]] のセマンティックチェック発掘を担った。AIOps(本番診断)と構成検証(デプロイ前防止)の両面でクラウド信頼性に投資している構図。 - [[OpenRCA]] 論文([[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]], ICLR 2025)の主要所属の一つ。10 著者中 [[Shilin He]]・[[Chaoyun Zhang]]・[[Qingwei Lin]]・Dongmei Zhang・Qi Zhang の 5 名が Microsoft 所属で、筆頭 [[Junjielong Xu]] も Microsoft DKI でのインターン中に実施した。AIOps 研究の延長として LLM の RCA 能力ベンチマーク化を担った。(Source: [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]]) - [[@2007__LISA__On Designing and Deploying Internet-Scale Services]](LISA '07)では、[[James Hamilton]] が Windows Live Services Platform のアーキテクトとして、MSN・Windows Live Search・Windows Live Mail・Exchange Hosted Services・Xbox Live 等の大規模サービス運用から蓄積した 20 年以上のベストプラクティスを体系化した。一部のサービスは 2.5 億ユーザ超に成長しており、インターネットスケールサービスの設計・運用知の成文化における先駆的論文である。Microsoft のクラウド運用研究の最も初期の系譜に位置づけられる。 - [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]](arXiv:2605.23348v1、2026-05-22)では、[[Debopam Bhattacherjee]] ら 10 名の Microsoft 研究者が [[AI Greenferencing]](風力発電サイトに GPU を配置する展開モデル)と [[XWind]](可変電力下での LLM 推論クロスサイトルーター)を提案。AI インフラのサステナビリティを電力源から再設計するアプローチで、Azure データセンターから 50ms RTT 以内に 890 GW 超の風力容量が存在するという実現可能性分析を示した。 - [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]](IEEE CAI 2026)では、[[Vaishali Vinay]] が Microsoft Security Research 所属として、LLM アプリケーションの失敗を推論・入力/コンテキスト・システム/運用の 3 層 15 種に分類した。Microsoft の GenAI 信頼性研究は、Azure OpenAI の本番インシデント分析、エージェント評価・運用自動化、AI インフラ設計に加えて、アプリケーション設計時の失敗モード整理にも広がっている。(Source: [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]]) - [[@2023__NSDI__Empowering Azure Storage with RDMA]](NSDI 2023)では、[[Wei Bai]] ら Microsoft の大規模著者群が、[[Azure Storage]] のフロントエンド/バックエンド通信を [[RDMA]] 化し、リージョン内規模で全 Azure パブリックリージョンに展開した経験を報告した。Microsoft のクラウド信頼性研究は AIOps/LLM 運用だけでなく、ストレージ・ネットワーク基盤の本番プロトコル設計と運用にも強い一次情報を持つ。 - [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]](ASE 2020)では、[[Qingwei Lin]] が対応著者として 18 Microsoft オンラインサービスの 6 か月分インシデントを分析し、incidental incidents が平均 50.32%・TTR の 55.05% を消費するという「半数以上が無視してよい」構造を初めて定量化。著者 11 名のうち 8 名が Microsoft(Research Beijing 5 + Azure Redmond 3)所属で、Microsoft の AIOps 研究系譜の早期論文。 - [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]](SIGCOMM 2016)では、[[Chuanxiong Guo]]・[[Haitao Wu]]・Zhong Deng・Gaurav Soni・Jianxi Ye・[[Jitendra Padhye]]・Marina Lipshteyn の全 7 名が Microsoft 所属として、RoCEv2 の大規模本番展開における DSCP-based PFC 設計・4 大安全課題(デッドロック/ライブロック/NIC PFC ストーム/スローレシーバー症状)の発見と解決・RDMA Pingmesh を報告した。この論文は後の [[@2023__NSDI__Empowering Azure Storage with RDMA]] や [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]] につながる Microsoft の RDMA 研究系譜の出発点に位置づけられる。 - [[@2025__ICLR__SCBench - A KV Cache-Centric Analysis of Long-Context Methods]](ICLR 2025)では、[[Huiqiang Jiang]](責任著者)ら Microsoft 研究グループが [[University of Surrey]] の [[Yucheng Li]] と共同で [[SCBench]] を提案。KV キャッシュのライフサイクル全体(生成・圧縮・検索・ローディング)を評価する初の包括的ベンチマークを構築し、8 カテゴリ・13 手法・8 LLM を評価した。sub-O(n) メモリ手法はマルチターン設定で実質破綻すること、動的スパース・アテンション(MInference)が最も堅牢であることを示した。 COMET([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]、ISSRE 2024)を2つの大規模クラウドサービスに6ヶ月以上展開し、LLM キーワード抽出によるインシデントトリアージで精度(ACC@1)30%改善・TTM 35%短縮を達成した。(Source: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]) [[Chaoyun Zhang]]・[[Qingwei Lin]]([[Microsoft]] Beijing)、[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]([[Microsoft]] Redmond/Seattle)が Build-bench 論文([[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)に共著者として参加。[[Nankai University]]・[[Peking University]]・[[Tsinghua University]] とのクロス ISA(x86_64/aarch64)ビルド修復ベンチマーク開発に寄与した。(Source: [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]) [[Daniel Genkin]]・[[Chaoyun Zhang]]・[[Rujia Wang]]・[[Chetan Bansal]]・[[Bhala Ranganathan]]・[[Saravan Rajmohan]]・[[Minghua Ma]](corresponding author)が TSGen 論文([[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]]、FSE Companion '26)に共著者として参加。[[Chongqing University]] の [[Yi Xiao]](筆頭)・[[Hongyu Zhang]] との共同で、過去インシデントレポートから LLM で構造化 TSG(Troubleshooting Guide)をゼロから自動生成する 3 段パイプライン(フィルタリング→蒸留→DAG 化生成)を提案。Microsoft の実インシデントデータで 54.8% のカバレッジ・ベースライン比約 3 倍の検索精度を達成し、実運用チームへのデプロイで生成 53 件中 38 件が採用された(受容率 約 71.7%)。[[FLASH]] が「既存 TSG をどう実行するか」を扱うのに対し、TSGen は「TSG が存在しない/古い状態からどう生成するか」という一段上流の課題を扱う、Microsoft の [[TSG自動化]] 研究群の新しい一角。(Source: [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]]) [[Chaoyun Zhang]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Dongmei Zhang]]・[[Saravan Rajmohan]]・[[Chetan Bansal]]・[[Minghua Ma]] が Aloha 論文([[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]、FSE Companion '26)に共著者として参加。[[Nankai University]] の [[Shenglin Zhang]](筆頭)・[[Yujia Wu]]・[[Jinghuan Ren]]・[[Wenwei Gu]]、責任著者 [[Yongqian Sun]] との共同で、対照分析ベースの異常箇所特定を human-in-the-loop エージェントでオペレーショナル化するフレームワークを提案し、Microsoft クラウドの 127 件の実バッチ障害ケースで有効性を実証した。(Source: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]) Comfey 論文([[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]]、FSE Companion '26)では、[[Yuhan Yao]]・[[Minghua Ma]]・[[Madhura Vaidya]]・[[Jieren Deng]]・[[Chetan Bansal]]・[[Ze Li]]・[[Murali Chintalapati]] の 7 名(Microsoft)が [[University of Michigan]] の [[Yuxuan Jiang]]・[[Boston University]] の [[Yigong Hu]] と共同で、Azure 本番環境向けの分散型エージェント型インシデントトリアージフレームワーク [[Comfey]] を提案した。22 か月間の本番稼働で約 19,500 件のインシデントを 91.5% の精度でトリアージし、先行の Microsoft 本番システム COMET と比較してトリアージ精度 +7.55%・トリアージ時間 4.38 倍・緩和時間 2.91 倍の改善を達成した。(Source: [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]]) AnoFusion 論文([[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]]、KDD '23)の共著者所属。[[Minghua Ma]]・[[Qingwei Lin]]・[[Dongmei Zhang]] が [[Nankai University]]・[[Tsinghua University]] と共同で、metric/log/trace のマルチモーダル相関を GTN+GAT で学習する教師なしインスタンス障害検知手法 [[AnoFusion]] を提案した。(Source: [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]]) [[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]](arXiv:2412.03594, MLSys 2026 Industry Track 採録)では、[[Zhen Zheng]](対応著者)・Xin Ji・Fanghao Zhou・Chuanjie Liu・Gang Peng の Microsoft 側著者が、[[Institute of Software, Chinese Academy of Sciences]] からインターンとして参加した Taosong Fang と共同で BatchLLM を開発した。大規模バッチ LLM 推論のグローバルプレフィックス共有と token バッチングに特化した最適化であり、[[LLM推論]] 高速化における Microsoft の研究群に、KV キャッシュ管理・スケジューリングの新しい切り口を加えた。(Source: [[@2024__arXiv__BatchLLM - Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching]]) [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]](MLSys 2026)では、[[Zhen Zheng]] が [[Together AI]] の [[Shuaiwen Leon Song]] と共同責任著者を務め、2-bit KV キャッシュ量子化のアルゴリズム-システム協調設計 Kitty を提案した。BatchLLM がスケジューリング・プレフィックス共有側から KV キャッシュ効率化に取り組むのに対し、Kitty は量子化・メモリレイアウト側から取り組む点で、Zhen Zheng の KV キャッシュ効率化研究の異なる切り口として位置づけられる。(Source: [[@2026__MLSys2026__Kitty - Accurate and Efficient 2-bit KV Cache Quantization with Dynamic Channel-wise Precision Boost]]) [[@2026__arXiv__Resilient AI Supercomputer Networking using MRC and SRv6]](arXiv:2605.04333、2026-05-05)では、OpenAI・Microsoft・AMD・Broadcom・NVIDIA 5 社連名で [[MRC]](Multipath RC)・[[マルチプレーンClosトポロジ]]・[[SRv6]] を co-design した耐障害ネットワークアーキテクチャを報告した。対応著者の一人 [email protected]([[Jithin Jose]])が Microsoft 側を代表し、[[Torsten Hoefler]]・[[Jitendra Padhye]] も共著者に名を連ねる。OpenAI と Microsoft の最大規模訓練クラスタで本番運用し、T0-T1 リンクフラップが定常的に発生しても修理は低優先度で済み、光トランシーバのグリッチが 4 リンクを同時フラップさせても訓練ジョブがクラッシュしない事例を報告した。Microsoft の RDMA 研究系譜([[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]]・[[@2023__NSDI__Empowering Azure Storage with RDMA]])の延長線上に位置し、大規模 AI 訓練クラスタ向けネットワーキングという新しい応用領域を加える。(Source: [[@2026__arXiv__Resilient AI Supercomputer Networking using MRC and SRv6]]) [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]](ICSE-SEIP '19)では、[[Tong Xia]](筆頭)・[[Sumit Bhardwaj]]・[[Aleksander Fabijan]] の Microsoft Corporation 側著者が、論文執筆当時 [[Outreach.io]] に所属していた [[Pavel Dmitriev]] と共同で、段階的ロールアウトの各リングにオンライン制御実験を適用する「制御ロールアウト(controlled rollout, CRL)」を提案した。Microsoft の Analysis and Experimentation(A&E)チームが年間1万件以上の制御実験・ロールアウトを実施しているという運用規模を報告するとともに、Microsoft Office での数百件の実運用ロールアウトを分析し、CRL が伝統的な段階的ロールアウトでは検知困難な10〜50%規模の指標変動を数日以内に検知できることを実証した。同論文は Microsoft の Windows Insider プログラム(内部2リング+外部3リング: fast/slow/release preview)を段階的ロールアウトの代表例として言及している。(Source: [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]]) ORACLE-SWE論文([[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]])では、[[Kenan Li]]・Liao Zhu・Xiaosong Huang・Yijia Wu・Yikai Zhang・Xin Zhang・Zijian Jin・Yufan Huang・Elsie Nallipogu・[[Chaoyun Zhang]]・Yu Kang・[[Saravan Rajmohan]]・[[Qingwei Lin]]・[[Dongmei Zhang]]の14名がMicrosoft側著者として参加し、[[Georgia Institute of Technology]]の[[Qirui Jin]](共同筆頭)・[[Wenke Lee]]と共同で、SWEエージェントが暗黙に依拠する5つの文脈情報信号(Reproduction Test・Regression Test・Edit Location・Execution Context・API Usage)の理想的な寄与上限を定量化するOracle-SWE手法を提案した。SWE-bench-Verified・Live・Proの3ベンチマークでReproduction Testが最も強い寄与を示すことを一貫して確認した。(Source: [[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]]) [[Martin Check]](Azure チーム SRE マネージャー)が『SREの探求』第4章([[@2021__OReillyJapan__SREの探求 - Chapter 4 インシデントのメトリクスを用いたSREの大規模な改善]])で、Azure における SRE 改善のケーススタディを執筆した。TTD(検出時間)・TTE(エンゲージ時間)・TTF(修正時間)・TTM(軽減時間)の定義、代理メトリクス(DRI Hops・自動検出率など)、修復負債・仮想修復負債という指標体系により、信頼性投資の優先順位づけを実践した事例であり、Microsoft の他ソース群が扱う AIOps・LLM ベースのインシデント対応研究(COMET・Comfey 等)とは異なり、指標設計と組織運用のプラクティスに焦点を当てる。(Source: [[@2021__OReillyJapan__SREの探求 - Chapter 4 インシデントのメトリクスを用いたSREの大規模な改善]]) [[Sam Schillace]](副CTOの一人)が[[Tim O'Reilly]]のエッセイ([[@2025__OReilly__The End of Programming as We Know It]])で、AIが「新しいプログラミングパラダイム」の発明過程にあると述べ、LLMがメタ認知(metacognition)を欠く点や、従来のソフトウェア工学がAI構築にそのまま通用しない可能性を指摘した。Microsoft の他ソース群がクラウド運用・AIOps という実装レイヤーの信頼性研究に集中するのに対し、この言及はプログラミングパラダイムそのものの変化という、より上位の産業論的視点を示す一例である。(Source: [[@2025__OReilly__The End of Programming as We Know It]]) [[Oleg Surmachev]]([[Microsoft Azure]] クラウドインフラストラクチャーチーム所属)が『カオスエンジニアリング ― 回復力のあるシステムの実践』6章([[@2022__OReillyJapan__カオスエンジニアリング - Chapter 6 Microsoftにおける実験の多様化と優先順位づけ]])を執筆し、Microsoft のグローバル規模クラウドインフラで運用してきたカオスエンジニアリングプログラムの実務知見として、実験結果の3カテゴリ分類・障害の優先順位づけ(発生頻度・対処確度・切迫度)・変化の度合い(単一/複合/波及障害)という枠組みを提示した。著者自身が Bing のインフラチーム在籍時に経験した、Microsoft本社のDNS設定不具合による全社的接続障害の実例(Outlook・Skype を含むあらゆるシステムが本社ごと世界から切り離された)を紹介し、部門ごとのサイロ化が設計領域外の障害シナリオの見落としを招くと指摘する。Microsoft の他ソース群が AIOps・LLM ベースのインシデント診断・ネットワーク基盤設計という「検知・診断・予防」側の信頼性研究に集中するのに対し、本章は「意図的な障害注入による事前検証」という異なる実践レイヤーの一次資料である。(Source: [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 6 Microsoftにおける実験の多様化と優先順位づけ]]) [[Rakesh Kelkar]]は、[[Knative]] ベースのサーバーレス機械学習推論プロジェクト [[KFServing]] を解説する [[@2020__arXiv__Serverless inferencing on Kubernetes]](ICML 2020 ワークショップ論文)の共著者。Microsoft の他ソース群が Azure OpenAI 等の生成AIクラウドサービス側の信頼性・インシデント研究に集中するのに対し、本ソースは2020年時点(LLM以前)の一般的な機械学習モデルのサーバーレス推論基盤という、より初期の機械学習インフラ運用の系譜に属する。(Source: [[@2020__arXiv__Serverless inferencing on Kubernetes]]) [[@2023__NSDI__Understanding RDMA Microarchitecture Resources for Performance Isolation]](NSDI 2023)では、[[Wei Bai]]・Mahmoud Elhaddad・Shachar Raindel・[[Jitendra Padhye]] の4名が Microsoft 側著者として参加し、[[Duke University]]・[[Shanghai Jiao Tong University]] の研究者と共同で RNIC マイクロアーキテクチャリソースを経由した性能分離違反を体系的に示すテストスイート Husky を発表した。Microsoft の RDMA 研究系譜([[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]]・[[@2023__NSDI__Empowering Azure Storage with RDMA]])が主に大規模展開の運用経験を扱うのに対し、本論文はゲスト VM へ RDMA を提供する際のマルチテナント性能分離という、パブリッククラウド化に向けた前段の課題を扱う。(Source: [[@2023__NSDI__Understanding RDMA Microarchitecture Resources for Performance Isolation]]) ## SONiCのオープンソース化とSmart Switch/DASHへの拡大(『実践SONiC入門』第2章) MicrosoftはSONiCを2016年にオープンソースとして公開し、翌2017年のAzure BLOG記事でその経緯・目的を解説した。数百か所のデータセンターで数万台規模のスイッチを運用してきた経験から、ネットワークの各階層に最適なスイッチングハードウェアを使えること、エンドユーザーに影響を与えず新機能を導入できること、数時間で(数週間ではなく)セキュアで信頼性の高いアップデートをスイッチ全体に展開できること、クラウドスケールのディープテレメトリーと自動化された障害緩和を活用できること、自社開発のSDNソフトウェアで統一的にネットワーク内の全ハードウェア要素を制御できることといった要件が明確になったと説明している。SAIとともにSONiCを公開しエコシステムを構築することで、Switch ASICベンダーや世代が変わってもソフトウェア資産への投資を無駄なく継続できるようになった。技術的な動機に加え、特定ベンダーへの依存を避ける「供給の冗長化」という目的も、2020年前後の半導体不足の経験を通じて重要性を増している。(Source: [[@2025__Gihyo__実践SONiC入門 - Chapter 2 SONiCの機能とユースケース]] ch.2 §2.2.1) 公開当初はシンプルなレイヤー2/3スイッチ機能を持つデータセンターファブリック向けスイッチとして利用されていたが、OCP 2023の発表ではVxLANとECMPを組み合わせた複数ノード分散ロードバランサーへのトラフィック平準化、Multi-Hop BFDによるエンドポイントヘルスチェック、REST APIによる柔軟なネットワークプログラマビリティといったユースケースが紹介された。近年ではSwitch ASIC以外のプラットフォームにも提供範囲を広げており、2023年に発表された「ネットワーク仮想アプライアンス(NVA)高速接続」サービスは、Switch ASICではなくSmartNIC上で[[SONiC-DASH]]を動作させている。2023年にはDPUとSwitch ASICを組み合わせたSmart Switchアプライアンス(8個のDPU + 12.8Tbps Switch ASIC)への適用も発表され、このSmart Switch+SONiC-DASH構成がNVA高速接続サービスで利用されている。SONiCを最初に提案・開発したMicrosoftが公開から9年以上経過した今でも適用ユースケースを広げ商用サービスでの利用を継続している。(Source: [[@2025__Gihyo__実践SONiC入門 - Chapter 2 SONiCの機能とユースケース]] ch.2 §2.2.1, §2.3.1) ## CXLベースのメモリプーリングとハードウェアコスト最適化 [[Scott Lee]](Microsoft、Azure以外の部門)は、[[@2023__ASPLOS__Pond - CXL-Based Memory Pooling Systems for Cloud Platforms]](ASPLOS '23、Distinguished Paper Award)の共著者としてPondのハードウェア設計(EMC: External Memory Controller)に関与した。同論文は[[Microsoft Azure]]所属の研究者陣が主導しつつ、Microsoft本体・[[Intel]]・[[Google]]・複数大学の研究者が協働した産学連携ハードウェア研究である。(Source: [[@2023__ASPLOS__Pond - CXL-Based Memory Pooling Systems for Cloud Platforms]]) ## マイクロサービス障害診断サーベイへの参加 [[Minghua Ma]](Redmond)がマイクロサービス障害診断包括サーベイ([[Failure Diagnosis in Microservice Systems]], arXiv 2024)に共著者として参加。[[Shenglin Zhang]]([[Nankai University]])を筆頭著者とするチームに [[Dan Pei]]([[Tsinghua University]])・[[Yongqian Sun]] とともに参加し、2003 年から現在までの 98 論文を対象に根本原因箇所特定(RCL)と障害分類(FC)を区別する問題定式化・マルチモーダルデータ taxonomy の構築に貢献した。(Source: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 1 Introduction]]) ## 関連 - ソース: [[@2023__ASPLOS__Pond - CXL-Based Memory Pooling Systems for Cloud Platforms]] / [[@2023__NSDI__Understanding RDMA Microarchitecture Resources for Performance Isolation]] / [[@2021__OReillyJapan__SREの探求 - Chapter 4 インシデントのメトリクスを用いたSREの大規模な改善]] / [[@2026__arXiv__ORACLE-SWE - Quantifying the Contribution of Oracle Information Signals on SWE Agents]] / [[@2019__ICSE-SEIP__Safe Velocity - A Practical Guide to Software Deployment at Scale using Controlled Rollout]] / [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]] / [[@2026__arXiv__Resilient AI Supercomputer Networking using MRC and SRv6]] / [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]] / [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] / [[@2007__LISA__On Designing and Deploying Internet-Scale Services]] / [[@2019__USENIX ATC__Analysis of Large-Scale Multi-Tenant GPU Clusters for DNN Training Workloads]] / [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] / [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]] / [[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]] / [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]] / [[@2026__arXiv__XWind - A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms]] / [[@2026__IEEE CAI__A System-Level Taxonomy of Failure Modes in Large Language Model Applications]] / [[@2026__Glenn K. Lockwood Blog__AI doesnt need giant supercomputers after all]] / [[@2023__NSDI__Empowering Azure Storage with RDMA]] / [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]] / [[@2025__ICLR__SCBench - A KV Cache-Centric Analysis of Long-Context Methods]] / [[@2022__OReillyJapan__カオスエンジニアリング - Chapter 6 Microsoftにおける実験の多様化と優先順位づけ]] / [[@2020__arXiv__Serverless inferencing on Kubernetes]] / [[@2024__ISCA__Splitwise - Efficient Generative LLM Inference Using Phase Splitting]] / [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]] - ML インフラ: [[Philly]] / [[philly-traces]] - 所属研究者: [[James Hamilton]](Windows Live Services Platform アーキテクト、2007 年)/ [[Minghua Ma]] / [[Yinfang Chen]](インターン)/ [[Haoran Yan]](インターン)/ [[Ryan Beckett]] / [[Shilin He]] / [[Qingwei Lin]] / [[Chaoyun Zhang]] / [[Junjielong Xu]](インターン)/ [[Debopam Bhattacherjee]] / [[Vaishali Vinay]] / [[Chuanxiong Guo]](RDMA 展開主導、2015-2016 年)/ [[Haitao Wu]] / [[Jitendra Padhye]] / [[Huiqiang Jiang]](LLM 推論効率化)/ [[Yuhan Yao]] / [[Madhura Vaidya]] / [[Jieren Deng]] / [[Chetan Bansal]] / [[Ze Li]] / [[Murali Chintalapati]] / [[Oleg Surmachev]](Azure クラウドインフラストラクチャーチーム、カオスエンジニアリング支持者) - 関連プロダクト: [[AIOpsLab]] / [[Microsoft Azure]] / [[Azure Storage]] / [[Zodiac]] / [[OpenRCA]] / [[XWind]] / [[Microsoft Fairwater]] / [[SCBench]] / [[Comfey]] / [[SONiC]] / [[SONiC-DASH]] - 関連ソース(ネットワーキング): [[@2025__Gihyo__実践SONiC入門 - Chapter 2 SONiCの機能とユースケース]] - 関連 MOC: [[AIOps - Failure Detection - MOC]] / [[LLM4SRE - MOC]] / [[Software Engineering - MOC]] ## 出典 - [[@2026__arXiv__The Multipath Reliable Connection (MRC) Transport]](MRC トランスポート仕様の共著組織の一つ)