# Ennan Zhai Alibaba Cloud 所属。[[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]](SIGCOMM 2025)および [[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures|SkyNet]](SIGCOMM 2025)の責任著者(corresponding author)の一人。SkyNet では severe network failure の alert flooding 分析システムを Alibaba Cloud の 89 DC × O(10⁵) デバイス本番に 1.5 年デプロイし、mitigation time 80% 削減を実証した([[@2025__SIGCOMM__SkyNet - Analyzing Alert Flooding from Severe Network Failures in Large Cloud Infrastructures]])。 - Alibaba Cloud の大規模 AI 訓練ネットワーク系の研究に広く関与する。本論文の参照には Ennan Zhai を共著者とする [[R-Pingmesh]](RoCE ネットワーク監視・診断、SIGCOMM 2024 [56])、Alibaba HPN(SIGCOMM 2024 [67])、C4(リアルタイム異常検知・通信最適化 [39])など、Alibaba Cloud の AI インフラ・ネットワークの主要研究が並ぶ。 - [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]](NSDI 2025)の責任著者(corresponding author)。AI モデル訓練クラウド向けの障害診断システム [[Aegis]] の設計・進化を率いる。 - [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]](HPCA 2025)の共著者。集約通信のリアルタイム異常検知・通信最適化システム [[C4]] に参画。 - [[@2026__NSDI__HeteCCL - Synthesizing Near-Optimal Collective Communication Schedules for Heterogeneous GPU Clusters]](NSDI 2026)の共著者。ヘテロジニアス GPU クラスタ向け集合通信スケジュール自動合成ツール HeteCCL に参画(Alibaba Cloud 所属として [[Northeastern University]] グループと協働)。 - [[@2025__SIGCOMM__Towards LLM-Based Failure Localization in Production-Scale Networks]](SIGCOMM 2025)の責任著者(corresponding author)の一人。LLM エージェントによる 3 パイプライン統合・階層推論・継続的プロンプト更新で本番ネットワークの障害箇所特定を実現するシステム [[BiAn]] を主導。17 か月 357 件評価で top-1 精度 95.5%、TTR 平均 20.5% 短縮(高リスク 55.2%)を達成。 - [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]](SIGCOMM 2026)の corresponding author の一人([[Xiaoxi Zhang]] と共同)。ネットワーク機器障害の根本原因分析(RCA)を、RLファインチューニング済みLLMによる推論チェーン抽出とSimRankベースの知識グラフ構築、多段階RAG推論で自動化する [[AIDA]] を主導。Alibaba Cloud本番ネットワークに1年以上展開され846件を処理、精度95.4%・TRCA中央値72.6時間→1.6分を達成。局所化を担う BiAn の後段で「なぜ壊れたか」を診断する位置づけであり、同一グループが局所化(BiAn)とRCA(AIDA)の両方を手がけていることを示す。(Source: [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]]) [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]](NSDI '26)の共著者。Alibaba Cloud の本番 LLM サービングワークロード特性化とワークロード生成フレームワーク [[ServeGen]] にも参画し、AI 訓練インフラだけでなく LLM サービング側の本番システム研究にも関与範囲を広げている。(Source: [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]]) [[StriaTrace]](OSDI 2026)の共著者として、Alibaba Group の本番 LLM 推論サービスにおける継続トレーシングと性能異常診断の研究に参加した。 ## 関連 - ソース: [[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]] / [[@2025__NSDI__Evolution of Aegis - Fault Diagnosis for AI Model Training Service in Production]] / [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]] / [[@2026__NSDI__EROICA - Online Performance Troubleshooting for Large-scale Model Training]] / [[@2026__NSDI__HeteCCL - Synthesizing Near-Optimal Collective Communication Schedules for Heterogeneous GPU Clusters]] / [[@2025__SIGCOMM__Towards LLM-Based Failure Localization in Production-Scale Networks]] / [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]] / [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]] / [[@2025__SIGCOMM__Alibaba Stellar - A New Generation RDMA Network for Cloud AI]] / [[@2025__NSDI__Mitigating Scalability Walls of RDMA-based Container Networks]] - 所属: [[Alibaba Cloud]] - 関連システム: [[R-Pingmesh]] / [[Aegis]] / [[C4]] / [[BiAn]] / [[AIDA]] - 共著者: [[Wei Liu]] / [[Kun Qian]] / [[Zhenhua Li]] / [[Tianyin Xu]] / [[Fei Feng]] / [[Xue Li]] / [[Weicheng Wang]] / [[Chen Tian]] / [[Guyue Liu]] / [[Dennis Cai]] / [[Xiaoxi Zhang]]