# Changhua Pei
Computer Network Information Center, Chinese Academy of Sciences(CNIC/CAS)および杭州先進研究院(Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences)所属の研究者(メール
[email protected])。[[Dan Pei]](清華大学)とは同名だが別人であり、著者一覧でも区別されている。(Source: [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]])
AIOps・マイクロサービス RCA の研究のほか、時系列予測研究にも取り組む。
SPRINT 論文([[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]], ICML 2026)の共著者として参加。[[Dan Pei]] グループとの共同研究で TSFM の推論時拡張フレームワークの開発に貢献した。(Source: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]])[[ByteDance]] と連携して Flow-of-Action を開発し、[[Dan Pei]]・[[Tieying Zhang]] ら [[ByteDance]]/清華大学の研究者と共著する。(Source: [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]])
UModel 論文([[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]], arXiv:2606.04799, 2026-06-03)の第一著者。[[Gaogang Xie]]・[[Dan Pei]] ら CNIC/CAS・UCAS・[[Alibaba Cloud]] の共同チームを率いてオブザーバビリティデータのオブジェクト中心統一モデリングフレームワーク [[UModel]] と [[U-SPL]] を設計・実装した。[[Alibaba Cloud]] の本番環境への 1 年以上のデプロイを主導し、RCA 精度 8% 向上を達成。(Source: [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]])
AgentOps サーベイ論文([[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]], arXiv:2606.01581)にも連絡著者として参加。(Source: [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]])
COMET 論文([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]]、ISSRE 2024)の共著者。[[Zexin Wang]]・[[Gaogang Xie]]と同じ CNIC CAS / UCAS 所属として、LLM キーワード抽出によるインシデントトリアージシステムの研究に参加。(Source: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]])
TADBench 論文([[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]], TSC 2025)の共著者(CNIC/CAS)。[[Yongqian Sun]](筆頭、[[Nankai University]])・Minyi Shao・[[Xiaohui Nie]](corresponding author)・Kaiwen Yang・Xingda Li・[[Bowen Hao]]・[[Shenglin Zhang]]([[Nankai University]])、Dongbiao He・Yanbiao Li(CNIC, CAS)、[[Dan Pei]]([[Tsinghua University]])との共同で、トレース異常検知アルゴリズムを横断比較する初の包括的ベンチマーク TADBench を提案した。5 公開データセットを統一フォーマットに標準化し約 21 万トレースに人手ラベルを付与、決定木ベースのアルゴリズム推奨戦略を提示した。UModel・Flow-of-Action に続き、[[Xiaohui Nie]] グループとの共同でトレース異常検知ベンチマークにも研究射程を広げた一本。(Source: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]])
HeaRank 論文([[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]]、KDD '26 V.2)の共著者(CNIC/CAS)。Difeng Ma(筆頭)・[[Gaogang Xie]] ら CNIC/CAS・UCAS チームおよび [[StepFun]] の [[Yibo Zhu]]・[[Dan Pei]]([[Tsinghua University]])との共同で、GPU 障害の時系列予測が本質的に困難であることを実証し、ホスト単位のリスクランキングへ再定式化する Learning-to-Rank モデル HeaRank を提案した。マイクロサービス RCA・AIOps 中心だった研究射程が、GPU ハードウェア信頼性という新しいドメインへ広がった一本。(Source: [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]])
## 関連
- ソース: [[@2026__arXiv__Don't Predict, Prioritize - Rethinking GPU Reliability Assessment]] / [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] / [[@2025__WWW__Flow-of-Action - SOP Enhanced LLM-Based Multi-Agent System for Root Cause Analysis]] / [[@2026__arXiv__UModel - An Agent-Ready Observability Data Modeling Method at Scale]] / [[@2026__arXiv__Agent System Operations - Categorization, Challenges, and Future Directions]] / [[@2026__arXiv__A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis]] / [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]]
- 関連研究者: [[Dan Pei]] / [[Tieying Zhang]] / [[Gaogang Xie]] / [[Zexin Wang]] / [[Xiaohui Nie]] / [[Shenglin Zhang]] / [[Bowen Hao]]
- 概念: [[根本原因分析]] / [[AIOps]] / [[オブザーバビリティデータモデル]] / [[トレース異常検知]]
- プロダクト: [[UModel]] / [[U-SPL]]