# Qingwei Lin [[Microsoft]] の研究者([email protected])。[[OpenRCA]] 論文([[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]])の共著者。(Source: [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]]) - [[Microsoft]] の AIOps・クラウドインシデント管理研究を長年牽引する研究者。[[Dan Pei]]・[[Minghua Ma]]・[[Chaoyun Zhang]]・[[Dongmei Zhang]] らと広く共同研究する。 - [[@2016__ICSE-C__Log Clustering Based Problem Identification for Online Service Systems]](ICSE Companion 2016)の筆頭著者として、LogCluster を提案。ログ系列のクラスタリングと知識ベースによる再発障害識別を組み合わせ、人手確認が必要なログ系列数を大幅に削減する。Microsoft の複数サービスチームへの 4 年以上の本番適用により有効性が確認された。本論文は [[@2019__WWW__Outage Prediction and Diagnosis for Cloud Service Systems|AirAlert]](WWW2019)論文が参照する「iDice ICSE2016・Log Clustering ICSE2016・AirAlert WWW2019・Gandalf NSDI2020」という AIOps 系譜の中核に位置する。 - [[StepFly]]([[@2025__arXiv__StepFly - Agentic Troubleshooting Guide Automation for Incident Diagnosis]])の共著者。[[TSG自動化]] の研究にも関与。 - [[@2021__ISSRE__How Long Will it Take to Mitigate this Incident for Online Service Systems]] の共著者(対応著者)として、インシデント TTM 予測研究を [[Microsoft Research]] 北京にて主導した。 - [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]] の対応著者として、[[DeepIP]](attention 付き CNN ベースのインシデント優先順位付け手法)研究を主導。本論文は 18 Microsoft オンラインサービスの incidental incidents 比率(平均 50.32%)と TTR コスト(平均 55.05%)を初めて定量化した実証研究 + 手法論文。 - [[@2019__WWW__Outage Prediction and Diagnosis for Cloud Service Systems|AirAlert]](WWW2019)の共著者として、Microsoft クラウドにおけるアウテージ予測の Bayesian network + XGBoost ハイブリッド設計を主導。本グループの AIOps 系譜(iDice ICSE2016・Log Clustering ICSE2016・AirAlert WWW2019・Gandalf NSDI2020 等)の初期に位置する。(Source: [[@2019__WWW__Outage Prediction and Diagnosis for Cloud Service Systems]]) - [[TraceArk]]([[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems]])の対応著者([email protected])として、Microsoft Exchange へのアクショナブル性能異常アラーティングの本番投入を主導した。(Source: [[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems]]) - [[LLMAD]]([[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]], KDD 2025)の共著者。LLM を直接 TSAD に使う初のフレームワーク。Microsoft AIOps 系譜の中で TraceArk(性能異常アラーティング)→ LLMAD(LLM 直接判定 + 解釈)という流れが浮かぶ。(Source: [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]]) - [[@2026__TVCG__RCInvestigator - Towards Better Investigation of Anomaly Root Causes in Cloud Computing Systems]](TVCG 2026)の共著者。[[Zhejiang University]] の [[Di Weng]]・[[Yingcai Wu]] らと協力し、ビジュアルアナリティクスによる人間-マシン協調 RCA システム RCInvestigator を開発。Microsoft 北京から jue.zhang, weiwei.cui, qlin, haidong.zhang が参加。(Source: [[@2026__TVCG__RCInvestigator - Towards Better Investigation of Anomaly Root Causes in Cloud Computing Systems]]) [[@2013__ASE__Software Analytics for Incident Management of Online Services - An Experience Report]](ASE 2013)の共著者として、SAS(Service Analysis Studio)の開発に参加。インシデントビーコン特定・不審実行パターンマイニング・反復インシデント処理の手法を [[Jian-Guang Lou]] らと共同研究した。 [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It|BRAIN]](ESEC/FSE 2020)の共著者(対応著者の 1 人)。[[Zhuangbin Chen]]・[[Yingnong Dang]]・[[Dongmei Zhang]] らと共著し、Microsoft 6 コアサービス 2 年超のインシデントデータ分析から IcM BRAIN フレームワークを設計・展開した。AIOps 系譜における pre-LLM 期の産業規模実証研究として最初期の論文の一つ。(Source: [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]]) COMET 論文([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]、ISSRE 2024)の共著者。LLM ベースのインシデントトリアージシステムを Microsoft の2クラウドサービスに本番展開する研究に参加。(Source: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]) Build-bench 論文([[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)の共著者([[Microsoft]] Beijing、[email protected])。[[Chenyu Zhao]]・[[Shenglin Zhang]]・[[Yongqian Sun]]([[Nankai University]])、[[Weilin Jin]]([[Peking University]])、[[Dan Pei]]([[Tsinghua University]])、[[Chaoyun Zhang]]・[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]との共同で、クロス ISA(x86_64/aarch64)ビルド失敗の LLM 修復能力を評価する初のベンチマーク Build-bench を提案した。(Source: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]) Aloha 論文([[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]、FSE Companion '26)の共著者([[Microsoft]])。[[Shenglin Zhang]](筆頭)・[[Yujia Wu]]・[[Jinghuan Ren]]・[[Wenwei Gu]]([[Nankai University]])、責任著者 [[Yongqian Sun]]([[Nankai University]])、[[Chaoyun Zhang]]・[[Liqun Li]]・[[Dongmei Zhang]]・[[Saravan Rajmohan]]・[[Chetan Bansal]]・[[Minghua Ma]]([[Microsoft]])との共同で、対照分析ベースの異常箇所特定を human-in-the-loop エージェントでオペレーショナル化するフレームワーク Aloha を提案した。(Source: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]) Observability-Aware Code 論文([[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]]、arXiv 2026-07)の共著者。[[Yongliang Tao]]([[Chongqing University]])・[[Hongyu Zhang]]・[[Pengfei Gao]]・[[Minghua Ma]]・[[Zhiyu Fan]]・[[Yu Kang]]・[[Jue Zhang]]・[[Si Qin]]・[[Liqun Li]]・[[Saravan Rajmohan]]との共同で、コーディングエージェント生成コードのオブザーバビリティをソース/実行時の 2 軸で評価した。(Source: [[@2026__arXiv__Can Large Language Models Generate Observability-Aware Code?]]) ## 関連 - 本ソース: [[@2013__ASE__Software Analytics for Incident Management of Online Services - An Experience Report]] / [[@2016__ICSE-C__Log Clustering Based Problem Identification for Online Service Systems]] / [[@2019__WWW__Outage Prediction and Diagnosis for Cloud Service Systems]] / [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]] / [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]] / [[@2025__KDD__Large Language Models can Deliver Accurate and Interpretable Time Series Anomaly Detection]] / [[@2026__TVCG__RCInvestigator - Towards Better Investigation of Anomaly Root Causes in Cloud Computing Systems]] / [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] - 所属: [[Microsoft]] - 共著: [[Shilin He]] / [[Chaoyun Zhang]] / [[Dan Pei]] / [[Minghua Ma]] / [[Di Weng]] / [[Yingcai Wu]] / [[Zhuangbin Chen]] / [[Yingnong Dang]] / [[Dongmei Zhang]] - 関連概念: [[AIOps]] / [[インシデント管理]] / [[根本原因分析]] / [[Interactive AIOps]] / [[クロスISAマイグレーション]]