# Changhua Pei
Computer Network Information Center, Chinese Academy of Sciences(CNIC/CAS)および杭州先進研究院(Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences)所属の研究者(メール
[email protected])。[[Dan Pei]](清華大学)とは同名だが別人であり、著者一覧でも区別されている。(Source: [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]])
AIOps・マイクロサービス RCA の研究のほか、時系列予測研究にも取り組む。
SPRINT 論文([[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]], ICML 2026)の共著者として参加。[[Dan Pei]] グループとの共同研究で TSFM の推論時拡張フレームワークの開発に貢献した。(Source: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]])[[ByteDance]] と連携して Flow-of-Action を開発し、[[Dan Pei]]・[[Tieying Zhang]] ら [[ByteDance]]/清華大学の研究者と共著する。(Source: [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]])
UModel 論文([[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]], arXiv:2606.04799, 2026-06-03)の第一著者。[[Gaogang Xie]]・[[Dan Pei]] ら CNIC/CAS・UCAS・[[Alibaba Cloud]] の共同チームを率いてオブザーバビリティデータのオブジェクト中心統一モデリングフレームワーク [[UModel]] と [[U-SPL]] を設計・実装した。[[Alibaba Cloud]] の本番環境への 1 年以上のデプロイを主導し、RCA 精度 8% 向上を達成。(Source: [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]])
AgentOps サーベイ論文([[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]], arXiv:2606.01581)にも連絡著者として参加。(Source: [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]])
COMET 論文([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]、ISSRE 2024)の共著者。[[Zexin Wang]]・[[Gaogang Xie]]と同じ CNIC CAS / UCAS 所属として、LLM キーワード抽出によるインシデントトリアージシステムの研究に参加。(Source: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]])
TADBench 論文([[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]], TSC 2025)の共著者(CNIC/CAS)。[[Yongqian Sun]](筆頭、[[Nankai University]])・Minyi Shao・[[Xiaohui Nie]](corresponding author)・Kaiwen Yang・Xingda Li・[[Bowen Hao]]・[[Shenglin Zhang]]([[Nankai University]])、Dongbiao He・Yanbiao Li(CNIC, CAS)、[[Dan Pei]]([[Tsinghua University]])との共同で、トレース異常検知アルゴリズムを横断比較する初の包括的ベンチマーク TADBench を提案した。5 公開データセットを統一フォーマットに標準化し約 21 万トレースに人手ラベルを付与、決定木ベースのアルゴリズム推奨戦略を提示した。UModel・Flow-of-Action に続き、[[Xiaohui Nie]] グループとの共同でトレース異常検知ベンチマークにも研究射程を広げた一本。(Source: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]])
HeaRank 論文([[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]]、KDD '26 V.2)の共著者(CNIC/CAS)。Difeng Ma(筆頭)・[[Gaogang Xie]] ら CNIC/CAS・UCAS チームおよび [[StepFun]] の [[Yibo Zhu]]・[[Dan Pei]]([[Tsinghua University]])との共同で、GPU 障害の時系列予測が本質的に困難であることを実証し、ホスト単位のリスクランキングへ再定式化する Learning-to-Rank モデル HeaRank を提案した。マイクロサービス RCA・AIOps 中心だった研究射程が、GPU ハードウェア信頼性という新しいドメインへ広がった一本。(Source: [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]])
TSLoc 論文([[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]]、KDD 2026)の corresponding author(
[email protected])。[[Quan Zhou]](筆頭)・[[Difeng Ma]]・[[Zexin Wang]]ら CNIC/CAS チームおよび [[StepFun]]・[[Dan Pei]] との共同で、健全ノードの群コンセンサスからの逸脱を検知する自己教師あり障害箇所特定フレームワーク TSLoc を提案した。共有 Mixture-of-Experts 時系列エンコーダ(自身の先行研究 [[KAN-AD]] をエキスパートに採用)で Top-5 精度 0.908 を達成し、HeaRank(GPU 障害の予知)と TSLoc(発生後の瞬時特定)という相補的な障害管理研究の両輪を CNIC/CAS・StepFun チームで確立した。(Source: [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]])
TFC 論文([[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]]、KDD '26 V.2)の共著者(CNIC/CAS、杭州先進研究院兼任)。[[Hang Cui]](筆頭)・[[Zexin Wang]](corresponding author)・[[Juncheng Hu]]・[[Haotian Si]]・[[Quan Zhou]]・[[Cenjie Hu]]・[[Jingjing Li]]・[[Dan Pei]]・[[Gaogang Xie]] との共同で、時間・周波数に加え離散二階差分(曲率)の視点を統合した TSAD フレームワーク TFC を提案し、6 ベンチマークで SOTA を達成した。TSLoc(発生後の障害箇所特定)・HeaRank(GPU 障害予知)に続き、時系列異常検知の基礎手法そのものへ研究射程を広げた一本。(Source: [[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]])
TSRBench 論文([[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]]、KDD '26 V.2)の corresponding author(
[email protected]、杭州先進研究院兼任)。[[Cenjie Hu]](筆頭)・[[Hang Cui]]・[[Zexin Wang]]・[[Juncheng Bao]]・[[Jingwen Yang]]・[[Jingjing Li]]・[[Dan Pei]]・[[Gaogang Xie]] との共同で、開放データセット UCR-R と産業インシデントデータセット CU-RCA、および single hit dominance を緩和する AdaBase Ranking Scorecard から成る時系列検索ベンチマークスイート TSRBench を提案した。TFC(時系列異常検知)・TSLoc(障害箇所特定)に続き、時系列検索という新しい評価軸へ研究射程を広げた一本。(Source: [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]])
Eagle 論文([[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]]、FSE Companion '26)の共著者(
[email protected]、[[Computer Network Information Center, Chinese Academy of Sciences]])。[[Yuhe Liu]]・[[Longlong Xu]]・[[Dan Pei]]([[Tsinghua University]] & [[BNRist]])、[[Hang Wang]](同じく CNIC)、[[Huawei Technologies]]・[[China Academy of Information and Communications Technology]] の共著者との共同で、Ops ドキュメントからベンチマーク QA を自動生成するフレームワーク [[Eagle (OpsLLMベンチマーク)]] を開発した。UModel・Flow-of-Action・TSLoc・TFC・TSRBench に続く、[[Dan Pei]] グループとの共同研究の一本であり、これまでの RCA・時系列異常検知・時系列検索という「診断・検索」路線に加え、OpsLLM 自体を評価するベンチマーク構築という新しい方向性を追加した。(Source: [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]])
RouterOPS 論文([[@2026__SIGCOMM Posters and Demos__Predict Boldly, Recover Cautiously : Fast On-Router Route Anomaly Prediction and Recovery]]、SIGCOMM Posters and Demos '26)の共著者(
[email protected]、[[Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences]] 兼任)。[[Hang Cui]](筆頭)・[[Cenjie Hu]]・[[Zexin Wang]]・[[Jingjing Li]]・[[Juncheng Hu]]・[[Dan Pei]]・[[Gaogang Xie]] との共同で、ルーターが自己/近隣の異常を検知し安全ガード付きでローカル復旧するルーターネイティブ軽量 AIOps フレームワーク RouterOPS を提案した。UModel・TFC・TSRBench に続き、CNIC/CAS グループの研究射程がネットワークルーティング層の障害予測・復旧に及んだ一本。(Source: [[@2026__SIGCOMM Posters and Demos__Predict Boldly, Recover Cautiously : Fast On-Router Route Anomaly Prediction and Recovery]])
LongRCA Bench 論文([[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]]、arXiv 2026-08)の共著者(corresponding author、
[email protected])。[[Yunfei Zhang]]・[[Boyu Feng]](共同筆頭)・[[Zexin Wang]]・[[Difeng Ma]]・[[Jingjing Li]]・[[Gaogang Xie]]・[[Dan Pei]] ら CNIC/CAS・[[Chongqing University]]・[[Tsinghua University]] チームとの共同で、5 つの実エージェントベンチマーク(SWE-bench Pro・Terminal Bench 2・TravelPlanner・VitaBench・WebArena Verified)から集めた 1,140 件の失敗軌跡に責任役割・根本原因ステップの人手ラベルを付した LongRCA Bench と、訓練不要の診断手法 RCTA を提案した。TSLoc(訓練クラスタの障害ノード特定)・HeaRank(GPU 障害予知)に続き、CNIC/CAS グループの「障害診断」研究射程が LLM マルチエージェントシステム自体の失敗帰属というドメインへ広がった一本。(Source: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]])
## 関連
- ソース: [[@2026__arXiv__LongRCA Bench - Diagnosing Responsible Roles and Root Causes in Long-Horizon Agent Failures]] / [[@2026__SIGCOMM Posters and Demos__Predict Boldly, Recover Cautiously : Fast On-Router Route Anomaly Prediction and Recovery]] / [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]] / [[@2026__KDD__Rethinking Time Series Anomaly Detection from a Dynamic Perspective - Temporal–Frequency–Curvature Fusion]] / [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]] / [[@2026__KDD__TSLoc - Self-Supervised Faulty Node Localization Framework in Large-scale Training Clusters]] / [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] / [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]] / [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]] / [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]] / [[@2026__arXiv__A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis]] / [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]] / [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]] / [[@2026__WWW2026__ViTs - Teaching Machines to See Time Series Anomalies Like Human Experts]]
- 関連研究者: [[Dan Pei]] / [[Tieying Zhang]] / [[Gaogang Xie]] / [[Zexin Wang]] / [[Xiaohui Nie]] / [[Shenglin Zhang]] / [[Bowen Hao]] / [[Hang Cui]] / [[Haotian Si]] / [[Cenjie Hu]] / [[Hang Wang]]
- 所属: [[Computer Network Information Center, Chinese Academy of Sciences]]
- 概念: [[根本原因分析]] / [[AIOps]] / [[オブザーバビリティデータモデル]] / [[トレース異常検知]] / [[異常検知]] / [[時系列類似度検索]] / [[LLM評価]]
- プロダクト: [[UModel]] / [[U-SPL]] / [[KAN-AD]] / [[TSLoc]] / [[TFC]] / [[TSRBench]] / [[Eagle (OpsLLMベンチマーク)]]