# Guangba Yu
[[Sun Yat-sen University]](広州)の研究者で、[[AlertGuardian]](ASE 2025)の筆頭著者。(Source: [[@2025__ASE__AlertGuardian - Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems]])
[[Pengfei Chen]] グループの一員として、AIOps・マイクロサービス信頼性・障害箇所特定/根本原因分析を中心に研究する。AlertGuardian の参考文献に現れる本人主導・共著の研究は広く、マルチモーダルオブザーバビリティデータでの細粒度 RCA「Nezha」(ESEC/FSE 2023)、スペクトル解析による遅延障害箇所特定「MicroRank」(WWW 2021)、ソフトウェア変更からの RCA「ChangeRCA」(FSE 2024)、コスト効率のマイクロサービススケーリング「Microscaler」、カーネルのログホットスポット削減「LogReducer」(ICSE 2023)、クラウド障害ライフサイクルのガイドライン(ISSRE 2022)などがある。
[[Cloud-OpsBench]](arXiv 2026)では責任著者(corresponding author)を務める。同論文の著者連絡先では所属が [[The Chinese University of Hong Kong]](
[email protected])と記される。(Source: [[@2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems]])
[[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis|L4]](FSE Companion '24 / arXiv 2503.20263)では責任著者(corresponding author)を務め、[[The Chinese University of Hong Kong]] 所属として登場する。LLM 訓練障害のログベース診断という、従来のマイクロサービス/クラウド RCA から LLM 訓練インフラへ研究関心が広がっていることを示す。(Source: [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]])
[[LLMPrism]](DSN 2025)の共著者でもあり、CUHK 所属として登場する。L4(ログベース)に続き、ネットワークフローベースの LLM 訓練性能診断にも関与し、LLM 訓練プラットフォームの可観測性へ研究を広げている。(Source: [[@2025__DSN__LLMPrism - Black-box Performance Diagnosis for Production LLM Training Platforms]])
[[Mint]](ASPLOS 2025)の共著者でもあり、[[Sun Yat-sen University]] 所属として登場する。SYSU 時代の [[Pengfei Chen]] グループでの分散トレーシング研究。(Source: [[@2025__ASPLOS__Mint - Cost-Efficient Tracing with All Requests Collection via Commonality and Variability Analysis]])
[[TraStrainer]](ESEC/FSE 2024)の共著者でもあり、[[Sun Yat-sen University]] 所属として登場する。システムランタイム状態を考慮した適応的トレースサンプリング。(Source: [[@2024__FSE__TraStrainer - Adaptive Sampling for Distributed Traces with System Runtime State]])
[[@2022__ICWS__TS-InvarNet - Anomaly Detection and Localization based on Tempo-spatial KPI Invariants in Distributed Services|TS-InvarNet]](ICWS 2022)の共著者でもあり、[[Sun Yat-sen University]] 所属として登場する。Zijun Hu・[[Pengfei Chen]](責任著者)・Zilong He・Xiaoyun Li と共に、KPI 不変条件ネットワーク(SARIMAX + HDBSCAN + グランジャー因果検定)に基づく解釈可能な異常検知・根本原因箇所特定フレームワークを提案した。(Source: [[@2022__ICWS__TS-InvarNet - Anomaly Detection and Localization based on Tempo-spatial KPI Invariants in Distributed Services]])
**[[FaaSRCA]]**(arXiv 2412.02239、2024年12月; ISSRE 2024 掲載とも言及)の共著者であり、[[Sun Yat-sen University]] 所属として登場する。[[Pengfei Chen]](責任著者)・Jin Huang らと共に、サーバーレスアプリケーション向けライフサイクル全体根本原因分析フレームワークを提案した。Global Call Graph (GCG) によるプラットフォーム/アプリ二層統合と GAT ベース教師なしグラフオートエンコーダを用い、平均 HR@k 91.54% を達成した。(Source: [[@2024__arXiv__FaaSRCA - Full Lifecycle Root Cause Analysis for Serverless Applications]])
**Nezha**(ESEC/FSE 2023)の筆頭著者であり、[[Sun Yat-sen University]] 所属として登場する。[[Pengfei Chen]](責任著者)・Yufeng Li・Hongyang Chen・Xiaoyun Li・[[Zibin Zheng]] と共に、マルチモーダルオブザーバビリティデータ(メトリクス・トレース・ログ)を均質なイベント表現に変換しイベントグラフを構築することでコード領域・リソースタイプレベルの細粒度根本原因を特定するフレームワークを提案した。教師なし手法でサービス内レベルの top-1 精度 89.77% を達成し、先行マルチモーダル手法 PDiagnose を TrainTicket で $A^S@5$ 75.56 ポイント上回った。(Source: [[@2023__ESEC-FSE__Nezha - Interpretable Fine-Grained Root Causes Analysis for Microservices on Multi-modal Observability Data]])
**TraceRank**(JSEP 2021)の筆頭著者でもあり、[[Sun Yat-sen University]] 所属として登場する。[[Zicheng Huang]]・[[Pengfei Chen]](責任著者)と共に、非集計エンドツーエンドトレースを活用したマイクロサービス根本原因分析システムを開発した。スペクトル解析とPageRankベースのランダムウォークを組み合わせることで、TrainTicket・BookInfo・実世界データセットで Precision 90%・Recall 86% を達成し、最良ベースライン比最大 10% 改善した。(Source: [[@2021__JSEP__TraceRank - Abnormal service localization with dis-aggregated end-to-end tracing data in cloud native systems]])
> [!contradiction] 所属表記の食い違い
> AlertGuardian(ASE 2025)では [[Sun Yat-sen University]] 所属として登場するが、Cloud-OpsBench(arXiv 2026)では [[The Chinese University of Hong Kong]](
[email protected])所属・責任著者と記される。所属の移籍・併任の可能性があり、いずれも出典どおりに保持する。
**COCA**(arXiv 2025-03-29)の責任著者(corresponding author)であり、SYSU メールアドレス(
[email protected])で登場する。Yichen Li・Yulun Wu・Jinyang Liu・[[Zhihan Jiang]]・Zhuangbin Chen・[[Michael R. Lyu]] と共に、分散システムのコードベースから実行パスを再構築して LLM の根本原因推論を補強するフレームワークを提案した。5 システム 106 件の実世界 JIRA イシューで [[RCACopilot]] 比 Exact Match +28.3% を達成した。(Source: [[@2025__arXiv__COCA - Generative Root Cause Analysis for Distributed Systems with Code Knowledge]])
**PreServe**(ICSE 2026)の共著者。[[Zhihan Jiang]] らと共に LMaaS 管理フレームワークを開発した。(Source: [[@2026__ICSE__PreServe - Intelligent Management for LMaaS Systems via Hierarchical Prediction]])
ACM TOSEM Vol. 35 No. 1(2025 年 12 月)に掲載された 142 本の研究を体系化した包括的サーベイ "A Survey on Failure Analysis and Fault Injection in AI Systems" の共著者。[[Roberto Natella]]([[University of Naples Federico II]])および SYSU/CUHK グループ([[Pengfei Chen]]・[[Zibin Zheng]]・[[Michael R. Lyu]])と共に、AI システムの障害分析(FA)と障害注入(FI)を 6 層タクソノミで整理した。著者連絡先では SYSU メール(
[email protected])で登場する。(Source: [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems]])
## 関連
- ソース: [[@2021__JSEP__TraceRank - Abnormal service localization with dis-aggregated end-to-end tracing data in cloud native systems]] / [[@2023__ESEC-FSE__Nezha - Interpretable Fine-Grained Root Causes Analysis for Microservices on Multi-modal Observability Data]] / [[@2024__FSE__ChangeRCA - Finding Root Causes from Software Changes in Large Online Systems]] / [[@2024__FSE__TraStrainer - Adaptive Sampling for Distributed Traces with System Runtime State]] / [[@2025__ASE__AlertGuardian - Intelligent Alert Life-Cycle Management for Large-scale Cloud Systems]] / [[@2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems]] / [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]] / [[@2023__ICSE__LogReducer - Identify and Reduce Log Hotspots in Kernel on the Fly]] / [[@2025__ASPLOS__Mint - Cost-Efficient Tracing with All Requests Collection via Commonality and Variability Analysis]] / [[@2022__ICWS__TS-InvarNet - Anomaly Detection and Localization based on Tempo-spatial KPI Invariants in Distributed Services]] / [[@2024__arXiv__FaaSRCA - Full Lifecycle Root Cause Analysis for Serverless Applications]] / [[@2025__arXiv__COCA - Generative Root Cause Analysis for Distributed Systems with Code Knowledge]] / [[@2026__ICSE__PreServe - Intelligent Management for LMaaS Systems via Hierarchical Prediction]] / [[@2025__TOSEM__A Survey on Failure Analysis and Fault Injection in AI Systems]]
- 所属: [[Sun Yat-sen University]](AlertGuardian, FaaSRCA) / [[The Chinese University of Hong Kong]](Cloud-OpsBench, L4, PreServe)
- 共同研究者: [[Pengfei Chen]] / [[Zicheng Huang]] / [[Michael R. Lyu]] / [[Zhihan Jiang]] / [[Roberto Natella]]
- 関連プロダクト: [[AlertGuardian]] / [[Cloud-OpsBench]] / [[LogReducer]] / [[Mint]] / [[TraStrainer]] / [[FaaSRCA]] / [[COCA]]
- 概念: [[AIOps]] / [[根本原因分析]] / [[異常検知]] / [[ログ解析]] / [[eBPF]] / [[分散トレーシング]] / [[サーバーレスRCA]] / [[コード知識強化RCA]] / [[LLMサービング管理]] / [[障害注入]] / [[障害分析]]