# Minghua Ma [[Microsoft]](Redmond)所属。[[AIOpsLab]]([[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]])の corresponding author([email protected])。 - AIOps・クラウドのインシデント管理の研究を Microsoft で広く手掛ける。AIOpsLab の参照には Ma が関与する研究が多数挙がる(例: Xpert によるインシデント管理のクエリ推薦、FLASH、ART、Robust Multimodal Failure Detection 等)。 - 本ソースの著者の多くが Microsoft 所属で、Ma はその AIOps 研究群の結節点に位置する。 - [[MonitorAssistant]]([[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]]、ESEC/FSE 2024 Industry Track)の責任著者。LLM をメタ層として実用的異常検知を実現するシステムを Microsoft のクラウドサービスに投入。[[Tsinghua University]] の [[Dan Pei]] グループ(NetManAIOps)との共同研究。 - [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]](ICSE 2026)の責任著者。GenAI クラウドサービスの本番インシデント 4 年分の大規模実証分析を主導。エージェント評価基盤(AIOpsLab)と本番インシデント実証の双方を率いる。 - [[FLASH]]([[@2024__MSR__FLASH - A Workflow Automation Agent for Diagnosing Recurring Incidents]])の共著者。本 wiki に取り込んだ [[TSG自動化]] の FLASH を Microsoft 側で支える。 - [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]](ESEC/FSE 2023)の共著者。Microsoft 300 超サービスのモニタリングギャップを実証分析し、[[MonitorAssistant]] の「実用的異常」定義の実証的根拠を提供する位置づけにある(Source: [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]])。 - iSQUAD 論文([[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]], PVLDB 2020)の筆頭著者。Tsinghua University に在籍しながら Alibaba Group でインターンシップ中に研究を実施した。[[iSQUAD]](Intermittent Slow QUery Anomaly Diagnoser)を [[Dan Pei]]・[[Shenglin Zhang]] らと共同設計し、Alibaba OLTP Database に本番展開した。[[間欠的遅延クエリ]]という問題を初めて定式化した研究である。(Source: [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]]) - 2021 年時点は [[Tsinghua University]] (BNRist) 所属。[[Dan Pei]] グループの学生として、JumpStarter([[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]], USENIX ATC 2021)の筆頭著者。圧縮センシングを多変量時系列異常検知に応用し、訓練不要・20 分初期化の手法を提案した。後に Microsoft へ移籍。(Source: [[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]]) - AutoMAP([[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]], WWW 2020)は匿名審査のため著者名未記載だが、論文中で MS-Rank[32]を「M. Ma, W-L. Lin, D-S. Pan, P. Wang」の研究として引用しており、同一グループ(Ma, Dan Pei ら)の連続研究である可能性が高い。AutoMAP は MS-Rank の自適応メトリクス選択を引き継ぎつつ、異常行動グラフ・加減算演算・プロファイル類似度を加えて大幅に発展させた。(Source: [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]]) - [[LLMAD]]([[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]], KDD 2025)の共著者。Microsoft 側として LLM を fine-tuning なしで TSAD に使う初のフレームワークの設計に関与。[[MonitorAssistant]] が LLM をメタ判断層に限定したのと対照的に、LLMAD は LLM を直接「判定器」として使う路線で、Microsoft 内の異常検知 LLM 化研究の 2 路線(検知器 vs メタ層)が併走していることを示す。(Source: [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]]) AgentTether 論文([[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]], arXiv 2026-07)の共著者。[[Chenyu Zhao]]・[[Shenglin Zhang]]([[Nankai University]])・[[Dan Pei]]([[Tsinghua University]])・[[Chetan Bansal]]・[[Saravan Rajmohan]]らとの共同で、LLM エージェントの失敗トレースを Critical Transition Graph で診断し実行時に修復するフレームワークを提案。Ma が Microsoft で主導してきたインフラ/クラウドサービス向け RCA(iSQUAD・JumpStarter・AutoMAP)・エージェント評価基盤(AIOpsLab)の系譜が、**エージェント自身の失敗した実行トレースを修復対象とする**方向へ拡張された研究として位置づけられる。(Source: [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]]) PROBE 論文([[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]], arXiv 2605.08717)の共著者。[[Chenyu Zhao]]・[[Shenglin Zhang]]([[Nankai University]])・[[Dan Pei]]([[Tsinghua University]])・[[Chetan Bansal]]・[[Saravan Rajmohan]] との共同で、AgentTether に先行する失敗起点構造化回復フレームワーク PROBE を提案。SWE-bench・EnterpriseOps-Gym・[[AIOpsLab]] の 257 件で Top-1 診断精度 65.37%・recovery rate 21.79% を達成し、診断精度改善が回復率改善を上回る diagnosis–recovery gap を実証した。さらに Microsoft IcM のサービス診断エージェントワークフローに非侵襲的な side channel として PROBE を統合するプロトタイプを検証しており、Ma が主導する [[AIOpsLab]] のエージェント評価基盤・本番インシデント実証研究([[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]])と並ぶ、産業応用に近い AIOps/エージェント運用研究の一角を占める。(Source: [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]]) COMET 論文([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]、ISSRE 2024)の corresponding author。AutoExtractor によるログ絞り込みと LLM キーワード抽出でインシデントトリアージを行うシステムを Microsoft の2クラウドサービスに6ヶ月以上展開し、オンラインで精度(ACC@1)30%改善・TTM 35%短縮を達成した。(Source: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]) Build-bench 論文([[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)の共著者。[[Chenyu Zhao]]・[[Shenglin Zhang]]・[[Yongqian Sun]]([[Nankai University]])、[[Weilin Jin]]([[Peking University]])、[[Dan Pei]]([[Tsinghua University]])、[[Chaoyun Zhang]]・[[Qingwei Lin]]・[[Chetan Bansal]]・[[Saravan Rajmohan]]との共同で、クロス ISA(x86_64/aarch64)ビルド失敗の LLM 修復能力を評価する初のベンチマーク Build-bench を提案した。AgentTether・PROBE と同じ著者グループが、エージェントの実行トレース診断からソフトウェアビルド修復まで研究対象を横断的に拡張している。(Source: [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]) RefinedEdge 論文([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], IEEE TSC 2025)の共著者。[[Nankai University]] の [[Shenglin Zhang]](筆頭)・[[Jiacheng Zhang]]・[[Shiqi Chen]]・[[Chenyu Zhao]]・[[Yutong Chen]]・[[Yongqian Sun]](corresponding author)、[[Alibaba Cloud]] の [[Guohua Liu]]、[[Tsinghua University]] の [[Dan Pei]] との共同で、多変量時系列異常検知(MTSAD)モデルをエッジ配備可能な水準まで圧縮しつつクラウド訓練モデルに匹敵する精度を達成する知識強化エッジクラウド協調フレームワーク [[RefinedEdge]] を提案した。2021 年の JumpStarter(圧縮センシングによる時系列異常検知)以来、Ma がクラウド側で培ってきた時系列 MTSAD の知見が、AgentTether・PROBE・Build-bench で共著してきた [[Nankai University]] グループとの共同で「エッジ配備向けモデル圧縮 + 知識蒸留」という新しい技術軸に接続された一本。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]]) Aloha 論文([[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]、FSE Companion '26)の共著者([[Microsoft]])。[[Shenglin Zhang]](筆頭)・[[Yujia Wu]]・[[Jinghuan Ren]]・[[Wenwei Gu]]([[Nankai University]])、責任著者 [[Yongqian Sun]]([[Nankai University]])、[[Chaoyun Zhang]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Dongmei Zhang]]・[[Saravan Rajmohan]]・[[Chetan Bansal]]との共同で、対照分析ベースの異常箇所特定を human-in-the-loop エージェントでオペレーショナル化するフレームワーク Aloha を提案した。iSQUAD・JumpStarter 以来 Ma が培ってきたクラウドデータベース/時系列異常診断の知見が、[[Nankai University]] グループとの共同でバッチ障害の対照分析診断に接続された一本。(Source: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]) Observability-Aware Code 論文([[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]]、arXiv 2026-07)の共著者。[[Yongliang Tao]]([[Chongqing University]])・[[Hongyu Zhang]]・[[Pengfei Gao]]・[[Zhiyu Fan]]・[[Yu Kang]]・[[Jue Zhang]]・[[Si Qin]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Saravan Rajmohan]]との共同で、コーディングエージェントが生成するコードのオブザーバビリティを、ソースレベルの診断意味論復元と実行時の障害シグナル露出の 2 軸で評価した。Ma がこれまで主導してきたインシデント管理・エージェント運用研究([[AIOpsLab]]・AgentTether・PROBE)の系譜が、「エージェント生成コードそのもののオブザーバビリティ」という生成時点の課題へ接続された一本。(Source: [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]]) TSGen 論文([[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]]、FSE Companion '26)の corresponding author。[[Yi Xiao]](筆頭)・[[Hongyu Zhang]]([[Chongqing University]])、[[Daniel Genkin]]・[[Chaoyun Zhang]]・[[Rujia Wang]]・[[Chetan Bansal]]・[[Bhala Ranganathan]]・[[Saravan Rajmohan]]との共同で、過去インシデントレポートから LLM で構造化 TSG をゼロから自動生成する 3 段パイプライン(フィルタリング→蒸留→DAG 化生成)を提案した。Microsoft の実インシデントデータで 54.8% のカバレッジ・ベースライン比約 3 倍の検索精度を達成し、生成 53 件中 38 件が実チームに採用された(受容率 約 71.7%)。Ma が主導する [[FLASH]](TSG 実行の信頼性)・[[TSG自動化]] の研究系譜に、「TSG そのものをどう生成するか」という一段上流の課題を追加する一本。(Source: [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]]) Comfey 論文([[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]]、FSE Companion '26)の共著者。[[Yuhan Yao]]・[[Yuxuan Jiang]]・[[Chetan Bansal]]・[[Ze Li]]・[[Murali Chintalapati]] らとの共同で、Microsoft Azure 本番環境向けの分散型エージェント型インシデントトリアージフレームワーク Comfey を提案。22 か月間の本番稼働で約 19,500 件のインシデントを 91.5% の精度でトリアージし、Ma 自身が corresponding author を務めた先行システム COMET と比較してトリアージ精度 +7.55%・トリアージ時間 4.38 倍・緩和時間 2.91 倍の改善を報告した。Ma のトリアージ研究の系譜は、iSQUAD・JumpStarter・AutoMAP(クラウドデータベース/マイクロサービスの根本原因分析)→COMET(中央集権的 LLM キーワードトリアージ)→Comfey(分散型・チームスコープドトリアージ)という一貫した進化を辿っている。(Source: [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]]) AnoFusion 論文([[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]]、KDD '23)の共著者。[[Chenyu Zhao]]・[[Shenglin Zhang]]([[Nankai University]])らとの共同で、metric/log/trace のマルチモーダル相関を GTN+GAT で学習し GRU で予測する教師なしインスタンス障害検知手法 [[AnoFusion]] を提案。2021 年の JumpStarter(metric 単一モダリティ)から 2 年後、Ma の時系列異常検知の知見がマルチモーダル(metric+log+trace)融合へ拡張された研究であり、本エントリ冒頭で言及されていた「Robust Multimodal Failure Detection」の出典がこれで判明した。(Source: [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]]) Aegis 論文([[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]]、ICSE-SEIP 2023)の共著者([[Microsoft Research]])。Xiaohan Yan(筆頭)・[[Ken Hsieh]]・[[Yasitha Liyanage]]・[[Murali Chintalapati]]([[Microsoft Azure]])、[[Qingwei Lin]]・[[Dongmei Zhang]]([[Microsoft Research]])、[[Yingnong Dang]]([[Microsoft Azure]])との共同で、Azure control plane の component/layer 横断変更影響帰属サービス [[Aegis (Azure Control Plane)]] を提案した。iSQUAD・JumpStarter・AutoMAP 以来の Ma のクラウド信頼性研究の系譜に、「変更起因の障害を computing layer をまたいで帰属させる」という新たな軸を加える一本。(Source: [[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]]) [[@2022__ESEC FSE__Constructing Large-Scale Real-World Benchmark Datasets for AIOps]](ESEC/FSE 2022 Industry Track)の共著者(⁴ [[Microsoft Research]])。[[Zeyan Li]]・[[Nengwen Zhao]]・[[Shenglin Zhang]]・[[Yongqian Sun]]・[[Pengfei Chen]]・[[Xidao Wen]]・[[Dan Pei]] との共同で、KPI 異常検知・多次元根本原因箇所特定・障害発見/診断の 3 公開データセットと年次 AIOps アルゴリズムコンペティションを紹介した。2021 年時点は Tsinghua/BNRist 所属(JumpStarter)だったが、本論文発表時点(2022 年)には既に Microsoft Research 所属として記載されており、Ma の Tsinghua → Microsoft 移籍時期を絞り込む手がかりになる。(Source: [[@2022__ESEC FSE__Constructing Large-Scale Real-World Benchmark Datasets for AIOps]]) マイクロサービス障害診断包括サーベイ([[Failure Diagnosis in Microservice Systems]], arXiv 2024)の共著者([[Microsoft]]、Redmond)。[[Shenglin Zhang]]([[Nankai University]])を筆頭著者とするチームに [[Dan Pei]]([[Tsinghua University]])・[[Yongqian Sun]] とともに参加し、98 論文を対象に根本原因箇所特定(RCL)と障害分類(FC)を区別する問題定式化と、ログ・メトリクス・トレースを中心とするマルチモーダルデータ taxonomy の構築に貢献した。AnoFusion(metric+log+trace 融合検知)で培ったマルチモーダル障害診断の知見が、サーベイの分類軸設計に活きていると読める。(Source: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis - Chapter 1 Introduction]]) ## 関連 - ソース: [[@2023__ICSE-SEIP__Aegis - Attribution of Control Plane Change Impact across Layers and Components for Cloud Systems]] / [[@2023__KDD__Robust Multimodal Failure Detection for Microservice Systems]] / [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]] / [[@2026__FSE Companion__TSGen - Automated Troubleshooting Guide Generation]] / [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]] / [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]] / [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] / [[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]] / [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]] / [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]] / [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]] / [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]] / [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]] / [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]] / [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]] / [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] - 所属: [[Microsoft]] - 関与プロダクト: [[AIOpsLab]] / [[MonitorAssistant]] / [[AgentTether]] / [[RefinedEdge]] / [[Comfey]] - 関連研究者: [[Yinfang Chen]] / [[Haoran Yan]] / [[Tianyin Xu]] / [[Dan Pei]] / [[Zhaoyang Yu]] / [[Chenyu Zhao]] / [[Shenglin Zhang]] / [[Jiacheng Zhang]] / [[Guohua Liu]] / [[Shiqi Chen]] / [[Yutong Chen]] / [[Yongqian Sun]] - 関連 MOC: [[AIOps - Failure Detection - MOC]] / [[LLM4SRE - MOC]] - 概念: [[知識蒸留]] / [[モデル圧縮]] / [[異常検知]] / [[Edge-cloud Collaboration]]