# Peking University 中国の大学。複数の研究グループが AIOps・DB 診断・LLM for SRE 研究を展開している。 - [[Lingzhe Zhang]]・[[Tong Jia]]・[[Ying Li]] らによる AIOps / LLM for SRE 研究(MicroRemed、LLM4AIOps サーベイ)。[[Alibaba Group]] と共同研究。 - 同グループはさらに [[Kangjin Wang]]・[[Chiming Duan]]・[[Minghua He]] を加え、[[Huawei Theory Lab]] との共同研究として [[@2026__TDSC__Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought]](RCLAgent, IEEE TDSC 採録)を発表。マイクロサービスのトレースグラフに沿ったマルチエージェント Recursion-of-Thought による根本原因特定フレームワークを提案した。 - 同グループ([[Minghua He]] 筆頭、[[Tong Jia]]・[[Ying Li]] corresponding)はログ表現学習に焦点を当て、[[@2026__arXiv__Bifrost - Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis]](Bifrost, ASE '26 採録)を発表。ログの実行フロー・イベント・コンポーネントという多階層構造を fallibility representation として定式化し、既存 PLM がこれを捉えられないことを経験的研究で示した上で、自己教師あり対照学習(EFP/AED/SCP)と最適化安定化戦略(CARL)を提案。[[Tsinghua University]] の [[Leyi Pan]]、[[Alibaba Group]] の [[Cheng Wang]]・[[Kangjin Wang]]・[[Yinghao Yu]]・[[Liping Zhang]] との共同研究。 - [[Bin Cui]] (IEEE Fellow)・[[Shiyue Huang]]・[[Yinjun Wu]] らによる AI4DB・データベース異常診断研究([[OpDiag]])。[[ZTE Corporation]] と ZTE-PKU 共同プログラムで産学連携。 - [[Dan Hao]] によるソフトウェア工学・AIOps 研究。[[Microsoft]]・[[Tianjin University]] と共同で [[DeepIP]] 論文([[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]])に参加し、アテンション付き CNN ベースのインシデント優先順位付け手法を開発。 - **[[Ping Wang]]**(国家ソフトウェア工学研究センター / ソフトウェア・マイクロエレクトロニクス学院)ら、CCGrid 2018 で CloudRanger を提案。PC アルゴリズムによるデータ駆動型インパクトグラフ構築と 2 次ランダムウォークによる根本原因特定を組み合わせ、IBM Bluemix 本番環境でトポロジ情報なしに MonitorRank を上回る精度(AC@1 59.4%)を達成。(Source: [[@2018__CCGrid__CloudRanger - Root Cause Identification for Cloud Native Systems]]) - OSDI 2024 の [[DistServe]] 論文([[@2024__OSDI__DistServe - Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving]])では、[[Yinmin Zhong]]・[[Shengyu Liu]]・[[Jianbo Hu]]・[[Xuanzhe Liu]]・[[Xin Jin]] が所属し、LLM 推論サービングの [[Prefill-Decode分離]] を Goodput 最適化として定式化した。 - [[Weilin Jin]](School of Computer Science)が Build-bench 論文([[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)に共著者として参加。[[Nankai University]]・[[Tsinghua University]]・[[Microsoft]] とのクロス ISA ビルド修復ベンチマーク開発に寄与した。(Source: [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]) - ソフトウェア・マイクロエレクトロニクス学院の [[Yuhang Zhang]]・**[[Meng Ma]]**(responsible author)・**[[Ping Wang]]** グループは、CloudRanger・G-Cause・JustDiag で培ったマイクロサービス系 RCA の知見を、KDD '26 の TRACER([[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]])で都市交通網の根本原因診断へ拡張した。運動学的衝撃波理論による物理接地とGranger因果性検定を組み合わせ、訓練不要のゼロショットエージェントとして SUMO シミュレーションと PeMS-BAY 実データの双方で既存手法を上回る精度・効率を達成した。国家ソフトウェア工学研究センター(SKLNST)・装備状態感知・スマートサポート国家重点実験室の助成を受ける。 - AIOps・LLM for SRE 系とは独立に、計算機科学学院にはネットワーク計測を専門とする研究室もある。[[Tong Yang]](准教授、責任著者)率いるグループが Qiuheng Yin・Hanglong Lyu・Yisen Hong とともに、[[ByteDance]](Douyin Vision Company Ltd.)の Long Chen・Mingwei Cui・Yangyang Bai・Ziwei Zhao と共同で、400Gbps 本番データセンター向けバイトレベルフロー監視システム FlowLog([[@2026__TON__FlowLog - Byte-Level Flow Monitoring System in High-Throughput Networks]], IEEE Transactions on Networking 2026)を開発した。ByteSketch という新規スケッチアルゴリズムを核とし、P4 プログラマブルゲートウェイ上で6ヶ月超の本番稼働実績を持つ。(Source: [[@2026__TON__FlowLog - Byte-Level Flow Monitoring System in High-Throughput Networks]]) - [[Hao Nie]]([[Alibaba Cloud]] と併任、共同筆頭著者)は、データセンタースイッチのポートミラーリング機能で allreduce トラフィックを傍受し訓練とチェックポインティングを分離するシステム FlowCheck を発表した(EuroSys '25)。(Source: [[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]]) - School of Computer Science の [[Xin Jin]] グループは、DistServe(LLM 推論の Prefill-Decode 分離設計)に続き、[[Yuxing Xiang]]・[[Yan Zhang]] を筆頭に [[Alibaba Group]] と共同で [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]](NSDI '26)を発表した。Alibaba Cloud Model Studio の本番クラスタから4か月間・12モデル・35.4億リクエストを収集し、言語・マルチモーダル・推論の3カテゴリで LLM サービングワークロードを横断的に特性化。少数の上位クライアントのレート変動がワークロード全体の変動パターンを支配するという「クライアント分解」の因果モデリングに基づき、ワークロード生成フレームワーク [[ServeGen]] を構築した。DistServe が LLM 推論システムの設計(Prefill-Decode分離)を扱ったのに対し、本論文はそのシステムをベンチマークするワークロードそのものの特性化・生成へと関心を広げている。(Source: [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]]) - [[Ying Li]] グループ([[Zongyang Li]] 筆頭)は [[ByteDance]] との共同研究として、緊急インシデントの根本原因変更を特定するハイブリッドシステム [[MagmaScope]]([[@2026__ICSE-SEIP__MagmaScope Identifying Root-Cause Changes for Emergency Incident in Large-Scale Cloud Infrastructure]], ICSE-SEIP '26)を開発した。IM グループチャットのマルチモーダルデータを第 4 のテレメトリとして活用し、変更チケット記述を LLM で意味的に標準化する Change Object Rewrite 技法が主要な貢献。55 件の実世界インシデントで Top@5 74.7%・Top@10 89.8% を達成し、1 年超の本番デプロイ実績を持つ。PKU-ByteDance 協力プロジェクト・CPSF 特別研究員プログラム助成。 - Key Lab of HCST (PKU), MOE の [[Junhao Hu]]([[Huawei Cloud]] でのインターン期間中に研究)と [[Tao Xie]](Chair Professor。旧 University of Illinois at Urbana-Champaign 教授で、DBLP は同一人物として両所属を記録する)は、Huawei Cloud のサーバーレス LLM サービング基盤 DeepServe([[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]]、USENIX ATC '25)の設計に参加した。DistServe(Xin Jin グループ)・ServeGen が学術主導で LLM 推論システムの設計・評価を扱うのに対し、DeepServe は Peking University の研究者が Huawei Cloud の本番プラットフォーム開発に直接インターン参加するという、産学連携の異なる形態を示す。(Source: [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]]) ## 関連 - 本ソース: [[@2025__EuroSys__FlowCheck - Decoupling Checkpointing and Training of Large-Scale Models]] / [[@2025__arXiv__MicroRemed - Benchmarking LLMs in Microservices Remediation]] / [[A Survey of AIOps in the Era of Large Language Models]] / [[@2025__TKDE__OpDiag - Unveiling Database Performance Anomalies Through Query Operator Attribution]] / [[@2024__OSDI__DistServe - Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving]] / [[@2018__CCGrid__CloudRanger - Root Cause Identification for Cloud Native Systems]] / [[@2026__TOSEM__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] / [[@2026__TDSC__Towards In-Depth Root Cause Localization for Microservices with Multi-Agent Recursion-of-Thought]] / [[@2026__TON__FlowLog - Byte-Level Flow Monitoring System in High-Throughput Networks]] / [[@2026__arXiv__Bifrost - Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis]] / [[@2026__KDD__TRACER - Physics-Guided Causal Evidence Construction for Zero-Shot Traffic Anomaly Diagnosis]] / [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]] / [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]] - 所属研究者: [[Lingzhe Zhang]] / [[Tong Jia]] / [[Ying Li]] / [[Kangjin Wang]] / [[Chiming Duan]] / [[Minghua He]] / [[Xinlong Zhao]] / [[Bin Cui]] / [[Shiyue Huang]] / [[Yinjun Wu]] / [[Yinmin Zhong]] / [[Shengyu Liu]] / [[Jianbo Hu]] / [[Xuanzhe Liu]] / [[Xin Jin]] / [[Ping Wang]] / [[Weilin Jin]] / [[Tong Yang]] / [[Meng Ma]] / [[Yuhang Zhang]] / [[Hao Nie]] / [[Yuxing Xiang]] / [[Yan Zhang]] / [[Junhao Hu]] / [[Tao Xie]] / [[Meng Qu]] / [[Mingzhe Wang]] / [[Ming Zhang (Peking University)]] - 共同研究: [[Alibaba Group]] / [[ZTE Corporation]] / [[Nankai University]] / [[Huawei Theory Lab]] / [[Tsinghua University]] / [[Huawei Cloud]] - 関連概念: [[AIOps]] / [[障害緩和]] / [[データベース自律診断]] / [[クロスISAマイグレーション]] / [[LLMによる根本原因分析]] / [[ログベース障害診断]] / [[Prefill-Decode分離]] - ソース: [[@2026__TACO__BridgedRing - A Cost-Effective Hardware-Software Co-Design to Overcome the UPI Bottleneck in GPU Servers]] / [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]] / [[@2015__WWW__LINE - Large-scale Information Network Embedding]]