# Dan Pei
[[Tsinghua University]] & BNRist 所属の教授。クラウドサービスの異常検知・根本原因分析・インシデント管理の研究グループ NetManAIOps を主宰する。
- iSQUAD 論文([[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]], PVLDB 2020)の senior author(
[email protected])。[[Minghua Ma]](Alibaba インターン)・[[Shenglin Zhang]] らとの共同で、クラウドデータベースにおける[[間欠的遅延クエリ]](iSQ)の根本原因を自動診断するフレームワーク [[iSQUAD]] を設計し Alibaba OLTP Database に本番展開した。iSQ という問題を初めて定式化した研究であり、重み付き F1 スコア 80.4%・DBSherlock 比 49.2% 上回る性能を達成した。(Source: [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]])
- AIOps の基盤的な研究を長年にわたり牽引。本 wiki の [[MonitorAssistant]] のほか、Opprentice(IMC 2015)、OmniAnomaly(KDD 2019)、**JumpStarter(USENIX ATC 2021)**、InterFusion(KDD 2021)、ImDiffusion(VLDB 2023)、Robust Multimodal Failure Detection(KDD 2023)等の異常検知研究、TraceDiag(ESEC/FSE 2023)の分散トレーシング解析など広範な出版を持つ。
- FluxRank 論文([[@2019__ISSRE__FluxRank - A Widely-Deployable Framework to Automatically Localizing Root Cause Machines for Software Service Failure Mitigation]], ISSRE 2019)の対応著者(
[email protected])。[[Ping Liu]]・[[Yu Chen (Baidu)]]・[[Xiaohui Nie]]・[[Jing Zhu (Tsinghua)]]・[[Shenglin Zhang]]・[[Kaixin Sui]]・[[Ming Zhang (CCB)]] との共同で、依存グラフ不要の根本原因マシン箇所特定フレームワーク FluxRank を提案した。KDE ベースの変化度量化・DBSCAN クラスタリング・ロジスティック回帰順位付けの 3 フェーズで構成され、70 件の実障害で Recall@1 = 55/70、手動比 80% 以上の時間削減を達成。7 サービスへの本番展開で 59 件中 55 件を top-1 で正解した。(Source: [[@2019__ISSRE__FluxRank - A Widely-Deployable Framework to Automatically Localizing Root Cause Machines for Software Service Failure Mitigation]])
- PatternMatcher 論文([[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems]], ISSRE 2021)の責任著者(
[email protected])。[[China Construction Bank]] と産学連携し、オンラインサービスにおける根本原因メトリクス特定手法を提案。3 ステップ(粗粒度異常検知・異常パターン分類・ランキング)で Avg@3 = 0.91 を達成し本番展開まで実施した。(Source: [[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems]])
- JumpStarter 論文([[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]], USENIX ATC 2021)の senior author(
[email protected])。[[Minghua Ma]]・[[Shenglin Zhang]] らとの共同で、圧縮センシングによる訓練不要・20 分初期化の多変量時系列異常検知手法を開発し、本番 8 億ユーザー規模のコンテンツプラットフォームへ適用した。(Source: [[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]])
- [[Microsoft]] の [[Minghua Ma]]・Qingwei Lin・Dongmei Zhang らと密接に共同研究。MonitorAssistant の参考文献の多くが Dan Pei グループの産物である。
- 学生の [[Zhaoyang Yu]] は異常検知・RCA に注力。
- SPRINT 論文([[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]], ICML 2026)に対応著者として参加。[[Longlong Xu]] らとともに推論時ダウンサンプリングフレームワーク [[SPRINT]] を開発し、任意の TSFM の精度・効率を同時改善する手法を提案した。(Source: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]])
- [[NexusRCL]] 論文([[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]], arXiv 2026-04)に共著者として参加(
[email protected])。[[Nankai University]] の [[Runzhou Wang]]・[[Shenglin Zhang]] らとの共同で、マイクロサービスにおけるエンティティレベル異質性の実証分析と半教師あり RCL フレームワークを提案した。(Source: [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]])
- UModel 論文([[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]], arXiv:2606.04799, 2026-06-03)に共著者として参加(
[email protected])。CNIC/CAS の [[Changhua Pei]]・[[Gaogang Xie]] ら、および [[Alibaba Cloud]] との共同で、エージェント対応のオブザーバビリティデータモデリングフレームワーク [[UModel]] の設計・検証に貢献した。(Source: [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]])
- [[OpenRCA]] 論文([[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]], ICLR 2025)に共著者として参加(
[email protected])。[[Microsoft]] の [[Shilin He]]・[[Qingwei Lin]]・[[Chaoyun Zhang]] と [[The Chinese University of Hong Kong, Shenzhen]] の [[Pinjia He]] グループとの共同で、LLM の RCA ベンチマークを構築した。(Source: [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]])
- [[Flow-of-Action]] 論文([[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]], WWW Companion '25)に共著者として参加。CNIC/CAS の [[Changhua Pei]] と [[ByteDance]] の [[Tieying Zhang]] らとの共同で、SOP 強化型マルチエージェント RCA システムを構築した。(Source: [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]])
- [[SCELM]] 論文([[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]], FSE Companion '25)に共著者として参加。[[Nankai University]] の [[Yongqian Sun]]・[[Shenglin Zhang]] らとの共同で、ECD・FT・RCCA 統合変更管理フレームワークを構築した。(Source: [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]])
- Lindorm TSDB 論文([[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]], PVLDB 2023)に共著者として参加(
[email protected])。[[Alibaba Group]] の [[Feifei Li]]・Wei Zhang らとの共同で、大規模監視システム向け分散時系列データベース [[Lindorm TSDB]] の設計・評価に貢献した。(Source: [[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]])
- CIRCA 論文([[@2022__KDD__Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition]], KDD 2022)に責任著者(
[email protected])として参加。[[Mingjie Li]]・[[Zeyan Li]]・[[Kanglin Yin]] と [[BizSeer]] の [[Xiaohui Nie]]・[[Wenchi Zhang]]・[[Kaixin Sui]] との共同で、RCA を因果推論の介入認識タスクとして定式化した CIRCA を提案した。(Source: [[@2022__KDD__Causal Inference-Based Root Cause Analysis for Online Service Systems with Intervention Recognition]])
- AIM サーベイ([[@2024__JNCA__A survey on intelligent management of alerts and incidents in IT services]], JNCA 2024)に通信著者として参加。[[Qingyang Yu]]・[[Nengwen Zhao]] らと [[BizSeer]] との共同で、alert/incident management の統一アーキテクチャを 2008-2022 の代表 89 件で体系化した。(Source: [[@2024__JNCA__A survey on intelligent management of alerts and incidents in IT services]])
- アラートストーム論文([[@2020__ICSE-SEIP__Understanding and Handling Alert Storm for Online Service Systems]], ICSE-SEIP 2020)の senior author(
[email protected])。[[Nengwen Zhao]]・[[Junjie Chen]] ら清華大・天津大・BizSeer・China EverBright Bank の共同で、最初のアラートストーム実証研究と EVT+iForest+DBSCAN を組み合わせた要約パイプラインを提案した。F1 スコア > 0.9 の検知精度とアラート件数 98% 超削減を達成し、[[China EverBright Bank]] での本番展開成功を報告した。(Source: [[@2020__ICSE-SEIP__Understanding and Handling Alert Storm for Online Service Systems]])
- eWarn 論文([[@2020__ESEC-FSE__Real-Time Incident Prediction for Online Service Systems]], ESEC/FSE '20)の共著者(
[email protected])。[[Nengwen Zhao]]([[Tsinghua University]])・[[Junjie Chen]](対応著者、[[Tianjin University]])・[[Zhou Wang]]([[BizSeer]])らおよび [[China EverBright Bank]] との産学連携で、アラートデータのみからリアルタイムにインシデントを予測する手法 eWarn を提案した。LDA テキスト特徴+統計特徴+multi-instance learning でノイズアラートを抑制し XGBoost+SMOTE で分類、LIME で予測根拠を説明する。大手商業銀行の 11 実サービスシステムで平均 F1 0.82(AirAlert 比 +0.31)を達成し、2 行への実運用適用と 4 件の成功事例を報告した。(Source: [[@2020__ESEC-FSE__Real-Time Incident Prediction for Online Service Systems]])
- AlertRCA 論文([[@2024__CCGRID__AlertRCA - Causality Enhanced Graph Representation Learning for Alert-Based Root Cause Analysis]], CCGRID 2024)の senior author(
[email protected])。[[Zhaoyang Yu]]・[[Qianyu Ouyang]]・CNIC/CAS の [[Changhua Pei]] ら多機関との共同で、アラートイベントのみを入力とするエンドツーエンド RCA 手法 [[AlertRCA]] を開発した。ADG・Alert2Vec・CPGAT・DAGNN から成る 4 段パイプラインで、手作業ルールを持つ Groot を top-1 精度で上回り、5,000 サービス規模の本番 EC データセットで top-1 83.9% / top-3 96.8% を達成した。(Source: [[@2024__CCGRID__AlertRCA - Causality Enhanced Graph Representation Learning for Alert-Based Root Cause Analysis]])
- [[UniDiag]] 論文([[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]], IEEE TSC 2024)の共著者(
[email protected])。[[Nankai University]] の [[Shenglin Zhang]]・[[Yongqian Sun]]・[[Yongxin Zhao]] らとの共同で、時系列知識グラフ(TKG)によるマルチモーダル障害診断フレームワークを提案した。(Source: [[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]])
- MicroDig 論文([[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]], TSC 2024)の共著者(
[email protected])。[[Nankai University]] の [[Shenglin Zhang]]・[[Lei Tao]] らとの共同で、大規模マイクロサービスシステムの性能問題診断手法 MicroDig を提案した。コールと各マイクロサービスの因果関係を捉えた異質伝播グラフ(HPG)と HORW アルゴリズムにより、[[Tencent]] の本番環境(8,000 超マイクロサービス)で top-3 精度 94.1% を達成した。(Source: [[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]])
- ResilienceGuardian 論文([[@2024__ISSRE__Guardian of the Resiliency - Detecting Erroneous Software Changes Before They Make Your Microservice System Less Fault-Resilient]], ISSRE 2024)の共著者(
[email protected])。[[Guanglei He]]・[[Xiaohui Nie]](corresponding author)・[[Ruming Tang]] ら清華大 / CAS / BizSeer の共同で、ESCR(障害耐性を低下させる誤りソフトウェア変更)を本番前に検知するフレームワーク [[ResilienceGuardian]] を開発した。256 件の実世界インシデント分析から ESCR が誤り変更の 37.87% を占めることを初めて定量化し、ステージング環境での障害注入 + 軽量 LSTM 分類器 + 転移学習の三位一体設計で F1=0.90・訓練時間 56〜98% 削減を達成した。(Source: [[@2024__ISSRE__Guardian of the Resiliency - Detecting Erroneous Software Changes Before They Make Your Microservice System Less Fault-Resilient]])
[[Build-bench]] 論文([[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)の共著者(
[email protected])。[[Chenyu Zhao]]・[[Shenglin Zhang]]・[[Yongqian Sun]]([[Nankai University]])、[[Weilin Jin]]([[Peking University]])、[[Chaoyun Zhang]]・[[Qingwei Lin]]・[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]([[Microsoft]])との共同で、クロス ISA(x86_64/aarch64)ビルド失敗の LLM 修復能力を評価する初のベンチマーク Build-bench を提案した。(Source: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]])
OScope 論文([[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]], ICSE-SEIP '26)の共著者(
[email protected])。[[Nankai University]] の [[Yongxin Zhao]](筆頭)・[[Shenglin Zhang]](責任著者)・[[Yuxin Sun]]・[[Wenwei Gu]]・[[Yongqian Sun]]、[[Alibaba Group]] の [[Luping Wang]]・[[Li Shi]]・[[Cheng Huang]]・[[Guodong Yang]]・[[Liping Zhang]] との共同で、OS 障害診断向け LLM フレームワーク [[OScope]] を提案した。マイクロサービス([[UniDiag]]・MicroDig 等)を主戦場としてきた同グループが OS レベル障害診断へ研究対象を拡張した一本。(Source: [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]])
RefinedEdge 論文([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], IEEE TSC 2025)の共著者(
[email protected])。[[Nankai University]] の [[Shenglin Zhang]](筆頭)・[[Jiacheng Zhang]]・[[Shiqi Chen]]・[[Chenyu Zhao]]・[[Yutong Chen]]・[[Yongqian Sun]](corresponding author)、[[Alibaba Cloud]] の [[Guohua Liu]]、[[Microsoft]] の [[Minghua Ma]] との共同で、多変量時系列異常検知(MTSAD)モデルをエッジ配備可能な水準まで圧縮しつつクラウド訓練モデルに匹敵する精度を達成する知識強化エッジクラウド協調フレームワーク [[RefinedEdge]] を提案した。0.12M パラメータの個人化学生モデルが EdgeNode/SMD/MSL/SMAP で F1=0.9588/0.9274/0.8827/0.8580 を達成し、SMD ではパラメータ比 1.7% で 7M パラメータの Cloud-Train モデルを凌駕した。RCA・障害診断・時系列基盤モデル(SPRINT・ChatTS)研究に続き、Pei の関与研究に「エッジクラウド協調 × モデル圧縮 × 知識蒸留」という新しい技術軸が加わった。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]])
- TADBench 論文([[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]], TSC 2025)の共著者([[Tsinghua University]] Department of Computer Science and Technology)。[[Yongqian Sun]](筆頭)・Minyi Shao・[[Xiaohui Nie]](corresponding author)・Kaiwen Yang・Xingda Li・[[Bowen Hao]]・[[Shenglin Zhang]]([[Nankai University]])、[[Changhua Pei]]・Dongbiao He・Yanbiao Li(CNIC, CAS)との共同で、トレース異常検知アルゴリズムを横断比較する初の包括的ベンチマーク TADBench を提案した。5 公開データセットを統一フォーマットに標準化し約 21 万トレースに人手ラベルを付与、トレース深さ・スパン数・サービス数・異常比率の 4 特性から最適アルゴリズムを選ぶ決定木ベースの推奨戦略を提示した。メトリクス・ログ・アラート中心だった Pei 関与研究に、トレースドメインの体系的ベンチマーク構築という技術路線が加わった一本。(Source: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]])
OpsMem 論文([[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]], arXiv 2026-07)の共著者(
[email protected])。[[Nankai University]] の [[Yongqian Sun]](筆頭)・[[Rongchen Gao]]・[[Yu Luo]]・[[Wenwei Gu]]・[[Shenglin Zhang]](責任著者)、[[Tsinghua University]] の [[Qingyi Guo]]、[[Huawei Technologies]] の [[Qiuai Fu]]・[[Yaoliang Wu]] との共同で、短期記憶(STM)と長期記憶(LTM)を cross-memory resonance で結合する失敗診断向けデュアルメモリフレームワーク [[OpsMem]] を提案した。同グループの [[OpsAgent]]・LagRCA・AgentTether・PROBE に連なる失敗診断エージェント系譜の最新作。(Source: [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]])
HeaRank 論文([[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]]、KDD '26 V.2)の共著者(所属: [[Tsinghua University]] Computer Science Department)。CNIC/CAS の [[Changhua Pei]]・[[Gaogang Xie]] らおよび [[StepFun]] の [[Yibo Zhu]] との共同で、GPU 障害の時系列予測が本質的に困難であることを実証し、Learning-to-Rank によるホストリスクランキングモデル HeaRank を提案した。マイクロサービス RCA・異常検知中心だった Pei の研究射程に、GPU ハードウェア信頼性という新しいドメインが加わった一本。(Source: [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]])
## 関連
- ソース: [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]] / [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]] / [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]] / [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] / [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]] / [[@2024__ISSRE__Guardian of the Resiliency - Detecting Erroneous Software Changes Before They Make Your Microservice System Less Fault-Resilient]] / [[@2022__ESEC FSE__Actionable and Interpretable Fault Localization for Recurring Failures in Online Service Systems]] / [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]] / [[@2019__ISSRE__FluxRank - A Widely-Deployable Framework to Automatically Localizing Root Cause Machines for Software Service Failure Mitigation]] / [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]] / [[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]] / [[@2021__ISSRE__Identifying Root-Cause Metrics for Incident Diagnosis in Online Service Systems]] / [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] / [[@2024__ESEC-FSE__MonitorAssistant - Simplifying Cloud Service Monitoring via Large Language Models]] / [[@2024__CCGRID__AlertRCA - Causality Enhanced Graph Representation Learning for Alert-Based Root Cause Analysis]] / [[@2025__ICLR__OpenRCA - Can Large Language Models Locate the Root Cause of Software Failures]] / [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]] / [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]] / [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]] / [[@2026__ASE__OpsAgent - An Evolving Multi-agent System for Incident Management in Microservices]] / [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]] / [[@2023__PVLDB__Lindorm TSDB - A Cloud-native Time-series Database for Large-scale Monitoring Systems]] / [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]] / [[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]] / [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]] / [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]] / [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]]
- 所属: [[Tsinghua University]]
- 関連研究者: [[Minghua Ma]] / [[Zhaoyang Yu]] / [[Changhua Pei]] / Qingwei Lin / [[Shenglin Zhang]] / [[Yongqian Sun]] / [[Tong Xiao]] / [[Xidao Wen]] / [[Wenwei Gu]] / [[Jiacheng Zhang]] / [[Guohua Liu]] / [[Shiqi Chen]] / [[Yutong Chen]] / [[Xiaohui Nie]] / [[Bowen Hao]]
- 関連プロダクト: [[LogInsight]] / [[MonitorAssistant]] / [[SCELM]] / [[AlertRCA]] / [[iSQUAD]] / [[UniDiag]] / [[Build-bench]] / [[LagRCA]] / [[OScope]] / [[PerfScout]] / [[RefinedEdge]]
- 概念: [[ログベース障害診断]] / [[異常検知]] / [[AIOps]] / [[根本原因分析]] / [[ソフトウェア変更管理]] / [[因果推論ベースRCA]] / [[グラフニューラルネットワーク]] / [[時系列知識グラフ]] / [[インシデントトリアージ]] / [[定常性モデル]] / [[知識蒸留]] / [[モデル圧縮]] / [[Edge-cloud Collaboration]]
- FluxInfer 論文([[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]], IPCCC 2020)の senior author(
[email protected])。[[Ping Liu]]・[[Shenglin Zhang]]・[[Yongqian Sun]]・[[Yuan Meng]]・[[Jiahai Yang]] との共同で、オンラインデータベースの性能異常に対する自動診断フレームワーク FluxInfer を提案した。重み付き無向依存グラフ(WUDG)と重み付き PageRank を組み合わせ、PC アルゴリズムに起因する潜在変数問題を根本的に回避しつつ AC@3=0.90・AC@5=0.95・Avg@5=0.77 で 9 ベースラインを平均 64%/60%/53% 上回った。(Source: [[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]])
- AutoMAP 論文([[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]], WWW 2020)は匿名審査のため著者名が記載されていないが、MS-Rank[32]の著者(M. Ma, W-L. Lin, D-S. Pan, P. Wang)と重複が強く疑われ、NetManAIOps グループの成果と推定される。マイクロサービス診断を「グレーボックス」として捉え、事前システム知識不要で top-5 精度 93.9%超を達成した。(Source: [[@2020__WWW__AutoMAP - Diagnose Your Microservice-based Web Applications Automatically]])
- CauseRank 論文([[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]], CCGrid 2022)の senior author。[[Xianglin Lu]]・[[Zeyan Li]]・[[Mingjie Li]]・[[Nengwen Zhao]]・[[Qingyang Yu]] ら清華大チームおよび [[BizSeer]] の [[Xiaohui Nie]]・[[Kaixin Sui]]、[[Nankai University]] の [[Shenglin Zhang]]・Lin Zhu らとの共同で、OLTP データベースシステム向け教師なし根本原因箇所特定手法を提案した。97 件の実世界 Oracle 障害で top-3 精度 82.5%・top-5 精度 93.8%・MAR 2.13 を達成した。(Source: [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]])
- [[ChatTS]] 論文([[@2025__VLDB__ChatTS - Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning]], PVLDB Vol. 18, 2025)の corresponding author(
[email protected])。[[Tieying Zhang]]([[ByteDance]])と並ぶ corresponding author 2 名のうちの 1 名。学生 [[Zhe Xie]]・[[Longlong Xu]] が筆頭/共著として参画し、時系列を画像同等のネイティブモダリティとして扱う初の TS-MLLM(完全合成データで fine-tuning)を NetManAIOps グループ + ByteDance + BizSeer の共同で構築した。本 wiki の [[MonitorAssistant]]・[[OneShotSTL]] など Dan Pei グループの「時系列 + LLM」研究系譜の延長に位置する。(Source: [[@2025__VLDB__ChatTS - Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning]])
- DéjàVu 論文([[@2022__ESEC FSE__Actionable and Interpretable Fault Localization for Recurring Failures in Online Service Systems]], ESEC/FSE 2022)の対応著者(
[email protected])。[[Zeyan Li]](清華大学)・[[Nengwen Zhao]]・Mingjie Li・Xianglin Lu ら清華大チームと [[BizSeer]]・[[China Construction Bank]] との産学連携で、[[再帰障害]](recurring failures)に特化した行動可能かつ解釈可能な障害箇所特定フレームワーク DéjàVu を提案した。GRU+1D-CNN による特徴抽出器と GAT 8 層による[[障害依存グラフ]](FDG)上の伝播モデリングを組み合わせ、4 システム 601 件の評価で MAR 1.66〜5.03 を達成し、ベースライン比 54.52%〜97.92% 改善。1 秒未満のオンライン箇所特定を実現した。(Source: [[@2022__ESEC FSE__Actionable and Interpretable Fault Localization for Recurring Failures in Online Service Systems]])
- [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph|LogKG]] 論文([[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]], IEEE Transactions on Services Computing 2023)の共著者。[[Nankai University]] の [[Yicheng Sui]]・[[Shenglin Zhang]] らおよび China Mobile Communications Corporation との産学連携で、ログの複数フィールド(タイムスタンプ・レベル・IP・コンポーネント・タスクID・コンテンツ)を知識グラフで統合する障害診断フレームワークを開発した。従来手法が無視していた構造化フィールド間の関係を RotatE による知識グラフ埋め込み(KGE)と FOLR(障害特化ログ表現)で活用し、CMCC データセットで精度 1.0・GAIA データセットで精度 0.98 を達成。Guangdong Mobile の本番環境(2000 以上のサービスインスタンス・1 日数億件のログ)へ 5 か月展開し、手動障害緩和時間を平均 20 分以上短縮した。(Source: [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]])
- AgentTether 論文([[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]], arXiv 2026-07)の共著者(所属 2、[[Tsinghua University]])。[[Chenyu Zhao]]・[[Shenglin Zhang]]・[[Wenwei Gu]]・[[Yongqian Sun]]([[Nankai University]])と [[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]([[Microsoft]])との共同で、LLM エージェントの失敗軌跡を Transition Unit のグラフ(Critical Transition Graph)として表現し、根本原因を局所化した上で保護付き実行時介入によって修正を維持するフレームワークを提案した。Pei が長年主導してきたマイクロサービス/クラウドインフラ向けグラフ RCA(DéjàVu の障害依存グラフ、AutoMAP、AlertRCA 等)の設計思想が、**エージェント自身の意思決定トレース**をグラフ化する対象に拡張された初の事例として位置づけられる。(Source: [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]])
- PROBE 論文([[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]], arXiv 2605.08717)の共著者(所属 2、[[Tsinghua University]])。[[Chenyu Zhao]]・[[Shenglin Zhang]]・Yihang Lin・[[Wenwei Gu]]・Zhimin Chen・[[Yongqian Sun]]([[Nankai University]])と [[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]([[Microsoft]])との共同で、AgentTether に先行する失敗起点構造化回復フレームワークを提案。テレメトリ→構造化証拠→構造化診断→範囲限定ガイダンスという段階的変換は、Pei が長年主導してきたグラフ RCA・因果推論ベース RCA の設計思想を、エージェント run のテレメトリという新しい対象へ適用した系譜の一部と位置づけられる。(Source: [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]])
- [[LagRCA]] 論文([[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]], FSE Companion '26)の共著者(所属: [[Tsinghua University]] & BNRist)。[[Shenglin Zhang]](筆頭)・[[Junhua Kuang]]・[[Yimeng Zhang]]・[[Sibo Xia]]・[[Jintao Feng]]・[[Jingyu Wang]]・[[Wenwei Gu]]・[[Yongqian Sun]]([[Nankai University]])、[[Wei Li]]・[[Liping Zhang]]([[Alibaba Group]])との共同で、マイクロサービス障害の可変時間ラグを明示的にモデル化する遅延認識時空間因果推論フレームワークを提案した。CIRCA(2022)・AlertRCA(2024)・DéjàVu(2022)と続く Pei グループのグラフベース RCA 系譜に、「時間ラグの明示的モデリング」という新しい軸を加えた成果と位置づけられる。D1(46 インスタンス・本番銀行データ)で AC@5=0.858(最良ベースライン比 +21.8 ポイント)を達成し、Alibaba 本番環境に 3 ヶ月間デプロイした。(Source: [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]])
- InsightTriage 論文([[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]], ASE '26 投稿版)の共著者(所属: [[Tsinghua University]])。[[Ruowei Fu]](筆頭)・[[Shenglin Zhang]](責任著者)・[[Wenwei Gu]]・[[Yongqian Sun]]([[Nankai University]])、Weiguo Li([[Huawei Technologies|Huawei Inc.]])との共同で、ICV(インテリジェント・コネクテッドビークル)向けの LLM 支援ジョイントチケット・ログ分析インシデントトリアージシステムを提案した。Huawei の実本番データ(4,526 件のインシデントチケット)で評価し、Weighted F1-Score 0.801 を達成。Pei が長年主導してきた「LLM + 構造化ドメイン知識」路線(LogKG・LogInsight 等)の車載ドメインへの展開といえる。(Source: [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]])
- [[PerfScout]] 論文([[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]], ICSE-SEIP '26)の共著者(
[email protected])。[[Nankai University]] の [[Yongqian Sun]]・[[Shenglin Zhang]](責任著者)・Qingliang Zhang・Xiao Xiong・Mengyao Li・Yimin Zuo、[[BizSeer]] の [[Xidao Wen]]・[[Wenwei Gu]]、[[Huawei Cloud]](成都)の Huandong Zhuang・Bowen Deng・Ruiyuan Wan との共同で、SPOT(極値理論)・ADF/KPSS(局所定常性判定)・PPO(強化学習)を統合した適応的ワークロード生成フレームワーク [[PerfScout]] を提案した。Huawei Cloud の CodeArts PerfTest に 9 か月間本番デプロイされ、ブレークポイント特定精度 82% 超・テスト効率改善 90% 近くを達成。RCA・異常検知を中心としてきた NetManAIOps グループが、性能テスト自動化という隣接領域(強化学習によるワークロード適応制御)に研究射程を広げた一本。(Source: [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]])