# Zhuangbin Chen [[Sun Yat-sen University]](Zhuhai)の研究者。[[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis|L4]](FSE Companion '24 / arXiv 2503.20263)の共著者。(Source: [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]]) [[@2021__ASE__Graph-based Incident Aggregation for Large-Scale Online Service Systems|GRLIA]](ASE 2021)の筆頭著者。論文発表時は [[The Chinese University of Hong Kong]] 所属で、Huawei Cloud Networking サービスの本番インシデントデータを用いたインシデント集約フレームワーク [[GRLIA]] を提案した。(Source: [[@2021__ASE__Graph-based Incident Aggregation for Large-Scale Online Service Systems]]) ログ解析・障害診断・ソフトウェア信頼性を専門とし、[[Michael R. Lyu]] グループ([[The Chinese University of Hong Kong]])と密接に共著する。本論文の参考文献には本人共著の関連研究として、ログ解析の信頼性工学サーベイ(ACM Comput. Surv. 2021)、適応的・スケーラブルなログ異常検知(arXiv 2023)、クラウドの隠れた機能クラスタを露出する Prism(ICSE 2023)などが挙がる。 [[@2025__ISSTA__Tracezip - Efficient Distributed Tracing via Trace Compression|Tracezip]](ISSTA 2025)の筆頭著者。スパン間の大域的冗長性を Span Retrieval Tree (SRT) で抽出するオンライントレース圧縮システムを提案し、[[OpenTelemetry]] Collector に実装。分散トレーシングのサンプリング研究(TraceMesh, CLOUD 2024)も手がけ、トレースの効率化を一貫して追求する。(Source: [[@2025__ISSTA__Tracezip - Efficient Distributed Tracing via Trace Compression]]) [[@2023__arXiv__Eadro - An End-to-End Troubleshooting Framework for Microservices on Multi-source Data|Eadro]](arXiv 2302.05092, 2023)の共著者(第 3 著者)。[[The Chinese University of Hong Kong]] 所属時代に [[Cheryl Lee]]・[[Tianyi Yang]] らと共同で、マルチソースデータ(トレース・ログ・KPI)を用いたマイクロサービスのエンドツーエンドトラブルシューティングフレームワークを設計した。特にホークス過程によるログイベント強度モデリングと GAT による依存グラフ学習を組み合わせた点で主要な貢献をした。(Source: [[@2023__arXiv__Eadro - An End-to-End Troubleshooting Framework for Microservices on Multi-source Data]]) [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It|BRAIN]](ESEC/FSE 2020)の共著者。[[Microsoft]] との共同研究として、2 年以上の Microsoft 本番インシデントデータを分析し、サービス依存性の不完全性・リソース健全性評価の不正確さという 2 つの重大課題を特定した。IcM BRAIN フレームワーク(インシデント検知・自動トリアージ・インシデント相関)の設計と評価を行い、5 指標(TTD/TTE/TTM/TTB/TTF)すべてで統計的有意な改善を実証した。本論文は [[Michael R. Lyu]] グループ([[The Chinese University of Hong Kong]])在籍時の成果であり、[[Qingwei Lin]]・[[Dongmei Zhang]]・[[Yingnong Dang]] ら Microsoft Research の研究者と協力した。(Source: [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]]) ## 関連 - ソース: [[@2021__ASE__Graph-based Incident Aggregation for Large-Scale Online Service Systems]] / [[@2020__ESEC-FSE__Towards Intelligent Incident Management - Why We Need It and How We Make It]] / [[@2023__arXiv__Eadro - An End-to-End Troubleshooting Framework for Microservices on Multi-source Data]] / [[@2025__ESEC-FSE__L4 - Diagnosing Large-scale LLM Training Failures via Automated Log Analysis]] / [[@2025__ISSTA__Tracezip - Efficient Distributed Tracing via Trace Compression]] - 所属: [[The Chinese University of Hong Kong]](〜2023 年時点) / [[Sun Yat-sen University]] - 関連研究者: [[Zhihan Jiang]] / [[Michael R. Lyu]] / [[Zibin Zheng]] / [[Cheryl Lee]] / [[Tianyi Yang]] / [[Qingwei Lin]] / [[Yingnong Dang]] - プロダクト: [[GRLIA]] / [[Tracezip]] / [[OpenTelemetry]] - 概念: [[ログ解析]] / [[根本原因分析]] / [[分散トレーシング]] / [[マルチモーダル障害診断]] / [[インシデント管理]]