# Minghua Ma [[Microsoft]](Redmond)所属。[[AIOpsLab]]([[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]])の corresponding author([email protected])。 - AIOps・クラウドのインシデント管理の研究を Microsoft で広く手掛ける。AIOpsLab の参照には Ma が関与する研究が多数挙がる(例: Xpert によるインシデント管理のクエリ推薦、FLASH、ART、Robust Multimodal Failure Detection 等)。 - 本ソースの著者の多くが Microsoft 所属で、Ma はその AIOps 研究群の結節点に位置する。 - [[MonitorAssistant]]([[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]]、ESEC/FSE 2024 Industry Track)の責任著者。LLM をメタ層として実用的異常検知を実現するシステムを Microsoft のクラウドサービスに投入。[[Tsinghua University]] の [[Dan Pei]] グループ(NetManAIOps)との共同研究。 - [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]](ICSE 2026)の責任著者。GenAI クラウドサービスの本番インシデント 4 年分の大規模実証分析を主導。エージェント評価基盤(AIOpsLab)と本番インシデント実証の双方を率いる。 - [[FLASH]]([[@2024__MSR__FLASH - A Workflow Automation Agent for Diagnosing Recurring Incidents]])の共著者。本 wiki に取り込んだ [[TSG自動化]] の FLASH を Microsoft 側で支える。 - [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]](ESEC/FSE 2023)の共著者。Microsoft 300 超サービスのモニタリングギャップを実証分析し、[[MonitorAssistant]] の「実用的異常」定義の実証的根拠を提供する位置づけにある(Source: [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]])。 - iSQUAD 論文([[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]], PVLDB 2020)の筆頭著者。Tsinghua University に在籍しながら Alibaba Group でインターンシップ中に研究を実施した。[[iSQUAD]](Intermittent Slow QUery Anomaly Diagnoser)を [[Dan Pei]]・[[Shenglin Zhang]] らと共同設計し、Alibaba OLTP Database に本番展開した。[[間欠的遅延クエリ]]という問題を初めて定式化した研究である。(Source: [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]]) - 2021 年時点は [[Tsinghua University]] (BNRist) 所属。[[Dan Pei]] グループの学生として、JumpStarter([[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]], USENIX ATC 2021)の筆頭著者。圧縮センシングを多変量時系列異常検知に応用し、訓練不要・20 分初期化の手法を提案した。後に Microsoft へ移籍。(Source: [[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]]) - AutoMAP([[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]], WWW 2020)は匿名審査のため著者名未記載だが、論文中で MS-Rank[32]を「M. Ma, W-L. Lin, D-S. Pan, P. Wang」の研究として引用しており、同一グループ(Ma, Dan Pei ら)の連続研究である可能性が高い。AutoMAP は MS-Rank の自適応メトリクス選択を引き継ぎつつ、異常行動グラフ・加減算演算・プロファイル類似度を加えて大幅に発展させた。(Source: [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]]) - [[LLMAD]]([[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]], KDD 2025)の共著者。Microsoft 側として LLM を fine-tuning なしで TSAD に使う初のフレームワークの設計に関与。[[MonitorAssistant]] が LLM をメタ判断層に限定したのと対照的に、LLMAD は LLM を直接「判定器」として使う路線で、Microsoft 内の異常検知 LLM 化研究の 2 路線(検知器 vs メタ層)が併走していることを示す。(Source: [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]]) AgentTether 論文([[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]], arXiv 2026-07)の共著者。[[Chenyu Zhao]]・[[Shenglin Zhang]]([[Nankai University]])・[[Dan Pei]]([[Tsinghua University]])・[[Chetan Bansal]]・[[Saravan Rajmohan]]らとの共同で、LLM エージェントの失敗トレースを Critical Transition Graph で診断し実行時に修復するフレームワークを提案。Ma が Microsoft で主導してきたインフラ/クラウドサービス向け RCA(iSQUAD・JumpStarter・AutoMAP)・エージェント評価基盤(AIOpsLab)の系譜が、**エージェント自身の失敗した実行トレースを修復対象とする**方向へ拡張された研究として位置づけられる。(Source: [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]]) PROBE 論文([[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]], arXiv 2605.08717)の共著者。[[Chenyu Zhao]]・[[Shenglin Zhang]]([[Nankai University]])・[[Dan Pei]]([[Tsinghua University]])・[[Chetan Bansal]]・[[Saravan Rajmohan]] との共同で、AgentTether に先行する失敗起点構造化回復フレームワーク PROBE を提案。SWE-bench・EnterpriseOps-Gym・[[AIOpsLab]] の 257 件で Top-1 診断精度 65.37%・recovery rate 21.79% を達成し、診断精度改善が回復率改善を上回る diagnosis–recovery gap を実証した。さらに Microsoft IcM のサービス診断エージェントワークフローに非侵襲的な side channel として PROBE を統合するプロトタイプを検証しており、Ma が主導する [[AIOpsLab]] のエージェント評価基盤・本番インシデント実証研究([[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]])と並ぶ、産業応用に近い AIOps/エージェント運用研究の一角を占める。(Source: [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]]) COMET 論文([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]、ISSRE 2024)の corresponding author。AutoExtractor によるログ絞り込みと LLM キーワード抽出でインシデントトリアージを行うシステムを Microsoft の2クラウドサービスに6ヶ月以上展開し、オンラインで精度(ACC@1)30%改善・TTM 35%短縮を達成した。(Source: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]) Build-bench 論文([[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)の共著者。[[Chenyu Zhao]]・[[Shenglin Zhang]]・[[Yongqian Sun]]([[Nankai University]])、[[Weilin Jin]]([[Peking University]])、[[Dan Pei]]([[Tsinghua University]])、[[Chaoyun Zhang]]・[[Qingwei Lin]]・[[Chetan Bansal]]・[[Saravan Rajmohan]]との共同で、クロス ISA(x86_64/aarch64)ビルド失敗の LLM 修復能力を評価する初のベンチマーク Build-bench を提案した。AgentTether・PROBE と同じ著者グループが、エージェントの実行トレース診断からソフトウェアビルド修復まで研究対象を横断的に拡張している。(Source: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]) RefinedEdge 論文([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], IEEE TSC 2025)の共著者。[[Nankai University]] の [[Shenglin Zhang]](筆頭)・[[Jiacheng Zhang]]・[[Shiqi Chen]]・[[Chenyu Zhao]]・[[Yutong Chen]]・[[Yongqian Sun]](corresponding author)、[[Alibaba Cloud]] の [[Guohua Liu]]、[[Tsinghua University]] の [[Dan Pei]] との共同で、多変量時系列異常検知(MTSAD)モデルをエッジ配備可能な水準まで圧縮しつつクラウド訓練モデルに匹敵する精度を達成する知識強化エッジクラウド協調フレームワーク [[RefinedEdge]] を提案した。2021 年の JumpStarter(圧縮センシングによる時系列異常検知)以来、Ma がクラウド側で培ってきた時系列 MTSAD の知見が、AgentTether・PROBE・Build-bench で共著してきた [[Nankai University]] グループとの共同で「エッジ配備向けモデル圧縮 + 知識蒸留」という新しい技術軸に接続された一本。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]]) Aloha 論文([[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]、FSE Companion '26)の共著者([[Microsoft]])。[[Shenglin Zhang]](筆頭)・[[Yujia Wu]]・[[Jinghuan Ren]]・[[Wenwei Gu]]([[Nankai University]])、責任著者 [[Yongqian Sun]]([[Nankai University]])、[[Chaoyun Zhang]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Dongmei Zhang]]・[[Saravan Rajmohan]]・[[Chetan Bansal]]との共同で、対照分析ベースの異常箇所特定を human-in-the-loop エージェントでオペレーショナル化するフレームワーク Aloha を提案した。iSQUAD・JumpStarter 以来 Ma が培ってきたクラウドデータベース/時系列異常診断の知見が、[[Nankai University]] グループとの共同でバッチ障害の対照分析診断に接続された一本。(Source: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]) Observability-Aware Code 論文([[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]]、arXiv 2026-07)の共著者。[[Yongliang Tao]]([[Chongqing University]])・[[Hongyu Zhang]]・[[Pengfei Gao]]・[[Zhiyu Fan]]・[[Yu Kang]]・[[Jue Zhang]]・[[Si Qin]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Saravan Rajmohan]]との共同で、コーディングエージェントが生成するコードのオブザーバビリティを、ソースレベルの診断意味論復元と実行時の障害シグナル露出の 2 軸で評価した。Ma がこれまで主導してきたインシデント管理・エージェント運用研究([[AIOpsLab]]・AgentTether・PROBE)の系譜が、「エージェント生成コードそのもののオブザーバビリティ」という生成時点の課題へ接続された一本。(Source: [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]]) ## 関連 - ソース: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]] / [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]] / [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] / [[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]] / [[@2026__ICSE__An Empirical Study of Production Incidents in Generative AI Cloud Services]] / [[@2023__ESEC-FSE__Detection Is Better Than Cure - A Cloud Incidents Perspective]] / [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]] / [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]] / [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]] / [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]] / [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]] / [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] - 所属: [[Microsoft]] - 関与プロダクト: [[AIOpsLab]] / [[MonitorAssistant]] / [[AgentTether]] / [[RefinedEdge]] - 関連研究者: [[Yinfang Chen]] / [[Haoran Yan]] / [[Tianyin Xu]] / [[Dan Pei]] / [[Zhaoyang Yu]] / [[Chenyu Zhao]] / [[Shenglin Zhang]] / [[Jiacheng Zhang]] / [[Guohua Liu]] / [[Shiqi Chen]] / [[Yutong Chen]] / [[Yongqian Sun]] - 関連 MOC: [[AIOps - Failure Detection - MOC]] / [[LLM4SRE - MOC]] - 概念: [[知識蒸留]] / [[モデル圧縮]] / [[異常検知]] / [[Edge-cloud Collaboration]]