# Shenglin Zhang [[Nankai University]] College of Software の准教授で同院の副院長。AIOps(異常検知・故障診断・根本原因分析・障害予測・変更管理)を長く牽引する。博士は [[Tsinghua University]] で取得し、指導教員は [[Dan Pei]] と Ying Liu。[[OptProphet]] 論文([[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]], APNet 2025)の共著者。[[SCELM]] 論文([[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]], FSE Companion '25)の責任著者([email protected])。[[FlowXpert]] 論文([[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]], KDD 2025)の責任著者でもあり、トラブルシューティングワークフロー自動生成と多エージェント共進化を Huawei Cloud との産学連携で実現した。(Source: [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]]) iSQUAD 論文([[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]], PVLDB 2020)の共著者([email protected])。Alibaba でのビジティングスカラーとして研究を実施。[[Minghua Ma]]・[[Dan Pei]] らとの共同で、クラウドデータベースにおける[[間欠的遅延クエリ]](iSQ)の根本原因診断フレームワーク [[iSQUAD]] を設計した。(Source: [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]]) JumpStarter 論文([[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]], USENIX ATC 2021)の corresponding author([email protected])。[[Minghua Ma]]・[[Dan Pei]] らとの共同で、圧縮センシングによる多変量時系列異常検知手法を設計し、訓練不要・20 分初期化・平均 F1 = 94.12% を達成した。(Source: [[@2021__USENIX-ATC__Jump-Starting Multivariate Time Series Anomaly Detection for Online Service Systems]]) [[NexusRCL]] 論文([[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]], arXiv 2026-04)の共著者([email protected])。[[Runzhou Wang]] を筆頭とするチームで、マイクロサービス RCL における entity-level 異質性の重要性を実証し、NexusRCL フレームワークを提案した。(Source: [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]]) FluxInfer 論文([[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]], IPCCC 2020)の共著者。[[Ping Liu]]・[[Yongqian Sun]]・[[Yuan Meng]]・[[Jiahai Yang]]・[[Dan Pei]] との共同で、データベース性能異常の自動診断フレームワークを提案。WUDG(重み付き無向依存グラフ)によるKPI依存関係の正確な表現と重み付き PageRank による根本原因箇所特定を実現した。(Source: [[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]]) CauseRank 論文([[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]], CCGrid 2022)の共著者。[[Dan Pei]] グループおよび [[BizSeer]] との共同で、OLTP データベースシステムの根本原因箇所特定手法 CauseRank を提案した。(Source: [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]]) LogKG 論文([[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]], IEEE Transactions on Services Computing)の責任著者([email protected])。筆頭著者 [[Yicheng Sui]] らと、ログの複数フィールドを知識グラフで統合する障害診断フレームワーク LogKG を提案した。[[Dan Pei]]([[Tsinghua University]])・China Mobile Communications Corporation との産学連携でGAIA・CMCCデータセット上での有効性を示し、Guangdong Mobile の本番環境に5か月展開して障害緩和時間を平均 20 分以上短縮した。(Source: [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]]) MicroDig 論文([[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]], TSC 2024)の責任著者([email protected])。[[Lei Tao]](筆頭)・Xianglin Lu・Jiaqi Luan・Yingke Li・Mingjie Li・[[Zeyan Li]](Tsinghua)・Qingyang Yu・Hucheng Xie・Ruijie Xu・Chenyuan Hu・Canqun Yang・[[Dan Pei]] との共同で、Tencent の大規模マイクロサービスシステム向け根本原因特定手法 MicroDig を提案した。「呼び出し関係と因果関係の不一致」を異質伝播グラフで解消し、top-3 精度 94.1%(Tencent 実環境)を達成。根本原因特定時間を 30〜60 分から 1 分未満に短縮した。(Source: [[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]]) Medicine フレームワーク([[@2024__ASE__Giving Every Modality a Voice in Microservice Failure Diagnosis via Multimodal Adaptive Optimization]], ASE 2024)の共著者。[[Lei Tao]]・[[Zhengdan Li]]・[[Yongqian Sun]]・[[Dan Pei]] らと共同で、マルチモーダル適応最適化(MAO)によるモダリティ独立型障害診断フレームワークを提案。3 公開データセットで既存マルチモーダル手法比 F1 スコアを 15.72〜70.84% 改善した。(Source: [[@2024__ASE__Giving Every Modality a Voice in Microservice Failure Diagnosis via Multimodal Adaptive Optimization]]) [[UniDiag]] 論文([[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]], IEEE TSC 2024)の責任著者([email protected])。[[Yongqian Sun]](corresponding author)・[[Yongxin Zhao]]・[[Dan Pei]] らとの共同で、時系列知識グラフ(TKG)を用いてメトリクス・ログ・トレースの 3 モダリティを統合する障害診断フレームワーク [[UniDiag]] を提案した。3σ ルールによるストリームベース異常検知・MOGE(R-GCN+GRU+SOPOOL)・HAC の 3 ステップ構成で、2 データセット上で Weighted Average F1=0.869/0.723 を達成し、最良ベースライン比 +0.117/+0.04 を実証。3 モダリティ全てを KG ベースで統合する初の試みと著者らは主張する。(Source: [[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]]) [[LagRCA]] 論文([[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]], FSE Companion '26)の筆頭著者。[[Junhua Kuang]]・[[Yimeng Zhang]]・[[Sibo Xia]]・[[Jintao Feng]]・[[Jingyu Wang]]・[[Wenwei Gu]]・[[Yongqian Sun]]([[Nankai University]])、[[Wei Li]]・[[Liping Zhang]]([[Alibaba Group]])、[[Dan Pei]]([[Tsinghua University]] & BNRist)との共同で、マイクロサービス障害の可変時間ラグを明示的にモデル化する遅延認識時空間因果推論フレームワークを提案した。D1(46 インスタンス・本番銀行データ)・D2(Online Boutique 41 インスタンス)で全ベースラインを上回り(AC@5: 0.858/0.883)、Alibaba 本番環境に 3 ヶ月間デプロイした。(Source: [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]]) AgentTether 論文([[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]], arXiv 2026-07)の責任著者。[[Chenyu Zhao]](筆頭)・[[Wenwei Gu]]・[[Yongqian Sun]](いずれも [[Nankai University]])、[[Dan Pei]]([[Tsinghua University]])、[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]([[Microsoft]])との共同で、従来のマイクロサービス RCA(サービス依存グラフ上の伝播)から一歩進み、LLM エージェント**単体の実行トレース**を Transition Unit のグラフ(Critical Transition Graph)として表現し、失敗の根本原因を局所化した上で実行時に修復を維持するフレームワーク AgentTether を提案した。τ-bench 261 タスクで Banking ドメインの初回失敗タスクの 59.04%(Qwen3.7-max)・65.12%(GPT-5.4)を修復。(Source: [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]]) PROBE 論文([[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]], arXiv 2605.08717)の責任著者(2 番目、AgentTether と同じ役割)。[[Chenyu Zhao]](筆頭)・Yihang Lin・[[Wenwei Gu]]・Zhimin Chen・[[Yongqian Sun]]・[[Dan Pei]]・[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]] との共同で、AgentTether に先行する失敗起点構造化回復フレームワークを提案。SWE-bench・EnterpriseOps-Gym・AIOpsLab の 257 件の初回未解決ケースで Top-1 診断精度 65.37%・recovery rate 21.79% を達成し、診断精度改善が回復率改善を上回る diagnosis–recovery gap を実証した。(Source: [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]]) Build-bench 論文([[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)の責任著者(∗†‡ 印、[email protected])。[[Chenyu Zhao]](筆頭)・Zeshun Huang・[[Yongqian Sun]](いずれも [[Nankai University]])、[[Weilin Jin]]([[Peking University]])、[[Dan Pei]]([[Tsinghua University]])、[[Chaoyun Zhang]]・[[Qingwei Lin]]・[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]]([[Microsoft]])との共同で、クロス ISA(x86_64/aarch64)ビルド失敗の LLM 修復能力を評価する初のベンチマーク [[Build-bench]] を提案した。AgentTether・PROBE と同じ著者グループが、LLM エージェントのソフトウェア工学タスク信頼性を扱う関連研究列としてビルド修復ドメインにも展開した一本。(Source: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]]) InsightTriage 論文([[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]], ASE '26 投稿版)の責任著者(corresponding author)。[[Ruowei Fu]](筆頭)・[[Wenwei Gu]]・[[Yongqian Sun]](いずれも [[Nankai University]])、Weiguo Li([[Huawei Technologies|Huawei Inc.]])、[[Dan Pei]]([[Tsinghua University]])との共同で、ICV(インテリジェント・コネクテッドビークル)向けの LLM 支援ジョイントチケット・ログ分析インシデントトリアージシステムを提案した。同著者グループの [[OncallX]](ByteDance 連携、汎用オンコール)とは対象ドメインとパートナー企業が異なり、Huawei との産学連携でログ分析の深さに焦点を当てた別系統の研究であることに注意。(Source: [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]]) CoTriage 論文([[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]])の責任著者([email protected])。[[Ruowei Fu]](筆頭)・Yang Zhang・Xin Wu・[[Wenwei Gu]]・Feng Wang・[[Zeyu Che]]・Xiaozhou Liu・[[Yongqian Sun]]・Yu Zhang([[ByteDance]])との共同で、LLM から SLM への知識蒸留 + 自己強化 + DPO によるチケットトリアージフレームワークを提案した。先行研究 [[OncallX]]([[@2025__ASE__LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation]])・InsightTriage([[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]])と合わせ、同一研究グループがチケット/インシデントトリアージ問題に対して「知識グラフ + fine-tuning-free」「ジョイントログ分析」「知識蒸留 + RL」という複数の技術路線を並行して追求している。(Source: [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]]) [[FoundRoot]] 論文([[@2026__ICSE__FoundRoot - Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking]], ICSE '26)の共著者。Zhe Xie(筆頭、[[Tsinghua University]])・[[Zeyan Li]]・[[Xiao He]]・[[Longlong Xu]]・Yuzhuo Yang(いずれも [[ByteDance]] または [[Tsinghua University]])・[[Tieying Zhang]]・[[Jianjun Chen]]・[[Rui Shi]]([[ByteDance]])・[[Dan Pei]]([[Tsinghua University]])との共同で、構造化深層思考([[構造化深層思考]])を LLM に内在化させたゼロショット RCA 向け強化学習(RL)強化 LLM 基盤モデル FoundRoot を提案した。warm-up SFT + DAPO による 2 段階訓練で、4 データセット全てにおいて古典的手法・LLM 手法の両方を MRR 4.5%〜48.6% 改善で上回った。本 wiki の Shenglin Zhang の関与研究列に、初めて「RL による LLM 基盤モデル訓練」という新しい技術路線が加わった。(Source: [[@2026__ICSE__FoundRoot - Towards Foundation Model for Root Cause Analysis via Structured Deep Thinking]]) OScope 論文([[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]], ICSE-SEIP '26)の責任著者([email protected])。[[Yongxin Zhao]](筆頭)・[[Yuxin Sun]]・[[Wenwei Gu]]・[[Yongqian Sun]](いずれも [[Nankai University]])、[[Alibaba Group]] の [[Luping Wang]]・[[Li Shi]]・[[Cheng Huang]]・[[Guodong Yang]]・[[Liping Zhang]]、[[Dan Pei]]([[Tsinghua University]])との共同で、OS 障害診断向け LLM フレームワーク [[OScope]] を提案した。症状記述の意味的不整合を解消する Knowledge Aligner・SOP ガイド逐次検証を担う Report Validator・OCE-LLM-in-the-Loop の 3 モジュール構成で、Alibaba 本番 101 件の OS 障害データセットで AC@5=0.901 を達成、3 ヶ月間の実デプロイで平均診断時間を約 112 分から約 1.5 分へ短縮した。マイクロサービス([[UniDiag]]・LogKG 等)・ログ([[LogInsight]])から OS レベル障害診断へと Shenglin Zhang の研究射程がさらに拡張された一本。(Source: [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]]) [[PerfScout]] 論文([[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]], ICSE-SEIP '26)の責任著者([email protected])。Qingliang Zhang・Xiao Xiong・Mengyao Li・Yimin Zuo([[Nankai University]])、[[Xidao Wen]]([[BizSeer]])、[[Wenwei Gu]]、Huandong Zhuang・Bowen Deng・Ruiyuan Wan([[Huawei Cloud]]、成都)、[[Dan Pei]]([[Tsinghua University]])との共同で、性能テストのワークロード生成を全自動化する強化学習ベースのフレームワーク [[PerfScout]] を提案した。SPOT(極値理論ベースの動的閾値)・ADF/KPSS(局所定常性判定)・PPO(強化学習ポリシー最適化)の 3 モジュールを統合し、固定閾値・ルールベースヒューリスティクスに依存する従来手法の汎化性の低さを克服する。Huawei Cloud のクラウドベース性能テストプラットフォーム CodeArts PerfTest に 9 か月間デプロイされ、実運用データセットでブレークポイント特定精度 82% 超・テスト効率改善 90% 近く・固定戦略比 87% のテスト時間短縮を実証した。UniDiag・LogKG・MicroDig 等でマイクロサービス障害診断を牽引してきた研究グループが、性能テスト自動化という新しい問題領域に展開した一本。(Source: [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]]) RefinedEdge 論文([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], IEEE TSC 2025)の筆頭著者。[[Jiacheng Zhang]]・[[Guohua Liu]]([[Alibaba Cloud]])・[[Shiqi Chen]]・[[Chenyu Zhao]]・[[Minghua Ma]]([[Microsoft]])・[[Yutong Chen]]・[[Yongqian Sun]](corresponding author)・[[Dan Pei]]([[Tsinghua University]])との共同で、多変量時系列異常検知(MTSAD)モデルをエッジ配備可能な水準(0.15M パラメータ未満)まで圧縮しつつクラウド訓練モデルに匹敵する精度を達成する知識強化エッジクラウド協調フレームワーク [[RefinedEdge]] を提案した。Aggregated Compression(集約データ + アンサンブルプルーニング)・Knowledge Refinement(統合蒸留 + 個人化)・Reciprocal Edge-Cloud Updating(逆蒸留による相互更新)の 3 モジュールで構成され、EdgeNode/SMD/MSL/SMAP の 4 データセットで 0.12M パラメータの個人化学生モデルが F1=0.9588/0.9274/0.8827/0.8580 を達成し、SMD ではパラメータ比 1.7% ながら 7M パラメータの Cloud-Train モデルを上回った。マイクロサービス障害診断・ログ解析中心だった Zhang の研究群に、エッジ資源制約下でのモデル圧縮・知識蒸留という時系列 MTSAD の新しい技術軸が加わった一本。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]]) LogSage 論文([[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]], Frontiers of Computer Science 2025)の責任著者([email protected])。[[Tianyu Cui]](筆頭)・[[Yicheng Sui]]・[[Zeyu Che]]・[[Yongqian Sun]](いずれも [[Nankai University]])と、[[ByteDance]] の Yang Zhang・Xin Wu・Liangyan Peng・Yuhe Ji・Feng Wang・Changchang Liu・Xiaozhou Liu・Yu Zhang との産学連携で、OS カーネルパニックのログベース RCA フレームワーク LogSage を提案した。障害指示ログ抽出(教師なしクラスタリング + LLM 要約、FILE)とグラフベース RCA(GraphSAGE + 能動学習、GARCA)の 2 段パイプラインで、ByteDance 本番データを含む 3 データセットで F1 92.2%/95.3%/96.3% を達成し、最強ベースライン LogKG を 15.5〜20.3 ポイント上回った。同著者陣の LogKG([[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]])が知識グラフでログフィールドを統合するアプローチだったのに対し、LogSage はグラフニューラルネットワーク(GraphSAGE)による表現学習と能動学習によるラベル効率化という異なる技術路線をとる。ByteDance のクラウド基盤に 6 ヶ月超デプロイされ、STE チームの RCA ワークフローに統合済み。(Source: [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]]) Aloha 論文([[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]、FSE Companion '26)の筆頭著者。[[Yujia Wu]]・[[Jinghuan Ren]]・[[Wenwei Gu]](いずれも [[Nankai University]])、責任著者 [[Yongqian Sun]]([[Nankai University]])、[[Chaoyun Zhang]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Dongmei Zhang]]・[[Saravan Rajmohan]]・[[Chetan Bansal]]・[[Minghua Ma]]([[Microsoft]])との共同で、対照分析(contrast analysis)ベースの異常箇所特定を Criterion-driven Applicability Protocol・Semantic-and-Executable Validation Toolkit・RAG-based Strategy Selection の 3 フェーズと human-in-the-loop 統合でオペレーショナル化するフレームワーク Aloha を提案した。Microsoft のクラウドで 127 件の実バッチ障害ケースをパイロットし、Top-5 推薦に真の根本原因を含める割合 93.7%・診断 1 件あたりの所要時間を約 10 時間から約 0.5 時間に短縮した。同グループが牽引してきた対照分析ベース障害診断([[CONAN]])の系譜に、「アルゴリズムではなく実務適用の usability gap」という新しい論点を持ち込んだ一本。(Source: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]) TADBench 論文([[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]], TSC 2025)の共著者([[Nankai University]] College of Software)。[[Yongqian Sun]](筆頭)・Minyi Shao・[[Xiaohui Nie]](corresponding author)・Kaiwen Yang・Xingda Li・[[Bowen Hao]]・[[Changhua Pei]]・Dongbiao He・Yanbiao Li・[[Dan Pei]] との共同で、トレース異常検知アルゴリズムを横断比較する初の包括的ベンチマーク TADBench を提案した。5 公開データセット(TrainTicket・GAIA・AIOps2020/2022/2023)を統一フォーマットに標準化し約 21 万トレースに人手ラベルを付与、単一の万能アルゴリズムは存在しないことを実証した上でトレース深さ・スパン数・サービス数・異常比率の 4 特性から最適アルゴリズムを選ぶ決定木ベースの推奨戦略を提示した。障害診断・RCA を中心としてきた Zhang の研究群に、トレース異常検知の体系的ベンチマーク構築という技術路線が加わった一本。(Source: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]]) OpsMem 論文([[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]], arXiv 2026-07)の責任著者(corresponding author)。[[Yongqian Sun]](筆頭)・[[Rongchen Gao]]・[[Yu Luo]]・[[Wenwei Gu]](いずれも [[Nankai University]])、[[Qingyi Guo]]・[[Dan Pei]]([[Tsinghua University]])、[[Qiuai Fu]]・[[Yaoliang Wu]]([[Huawei Technologies]])との共同で、短期記憶(STM)と長期記憶(LTM)を cross-memory resonance で結合する失敗診断向けデュアルメモリフレームワーク [[OpsMem]] を提案した。Huawei の実運用マイクロサービス障害 120 件データセットで、ReAct・GoS・GoS+RAG 系ベースラインを一貫して上回った(最強ベースライン比 Match +6.66〜25.00pt)。同グループの [[OpsAgent]]・LagRCA・AgentTether・PROBE に連なる失敗診断エージェント系譜の最新作であり、STM は GoS(参考文献 [13]、[[Yu Luo]] 筆頭)の belief-state 抽象化を踏襲する。(Source: [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]]) ## 関連 マイクロサービス障害診断包括サーベイ([[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis]], arXiv 2024)の筆頭著者。Nankai University のチームを率いて 98 論文を調査し、ログ・メトリクス・トレース・マルチモーダルの 4 カテゴリ分類体系を構築。根本原因箇所特定(RCL)と障害種別分類(FC)の問題設定を整理し、公開データセット・ツールキット・評価メトリクスを初めて体系化した包括サーベイ。(Source: [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis]]) ## 関連 - ソース: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]] / [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] / [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] / [[@2020__PVLDB__Diagnosing Root Causes of Intermittent Slow Queries in Cloud Databases]] / [[@2020__IPCCC__FluxInfer - Automatic Diagnosis of Performance Anomaly for Online Database System]] / [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] / [[@2024__arXiv__Failure Diagnosis in Microservice Systems - A Comprehensive Survey and Analysis]] / [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]] / [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]] / [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]] / [[@2026__ASE__OpsAgent - An Evolving Multi-agent System for Incident Management in Microservices]] / [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]] / [[@2022__CCGrid__Generic and Robust Performance Diagnosis via Causal Inference for OLTP Database Systems]] / [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]] / [[@2026__TSC__LLM-Enhanced Failure Localization in Microservices - Integrating Multi-Modal Data and Expert Interpretation]] / [[@2024__TSC__No More Data Silos - Unified Microservice Failure Diagnosis With Temporal Knowledge Graph]] / [[@2025__nkcs.iops.ai__Accurate and Interpretable Log-Based Fault Diagnosis using Large Language Models]] / [[@2024__TSC__MicroDig - Diagnosing Performance Issues for Large-Scale Microservice Systems With Heterogeneous Graph]] / [[@2024__ASE__ART - A Unified Unsupervised Framework for Incident Management in Microservice Systems]] / [[@2026__arXiv__AgentTether - Graph-Guided Diagnosis and Runtime Intervention for Reliable LLM Agent Operations]] / [[@2026__arXiv__Debugging the Debuggers - Failure-Anchored Structured Recovery for Software Engineering Agents]] / [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]] / [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]] / [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]] / [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]] - 所属: [[Nankai University]] / [[Tsinghua University]](博士) - 共同研究者: [[Yongqian Sun]] / [[Shiyu Ma]] / [[Yongxin Zhao]] / [[Sibo Xia]] / [[Dan Pei]] / [[Lei Tao]] / [[Zhengdan Li]] / [[Chenyu Zhao]] / [[Wenwei Gu]] / [[Junhua Kuang]] / [[Yimeng Zhang]] / [[Jintao Feng]] / [[Jingyu Wang]] / [[Ruowei Fu]] / [[Zeyu Che]] / [[Yuxin Sun]] / [[Xidao Wen]] / [[Jiacheng Zhang]] / [[Guohua Liu]] / [[Shiqi Chen]] / [[Minghua Ma]] / [[Yutong Chen]] / [[Tianyu Cui]] / [[Yicheng Sui]] / [[Xiaohui Nie]] / [[Changhua Pei]] / [[Bowen Hao]] - 関連プロダクト: [[LogInsight]] / [[OptProphet]] / [[SCELM]] / [[FlowXpert]] / [[@2024__ASE__Giving Every Modality a Voice in Microservice Failure Diagnosis via Multimodal Adaptive Optimization|Medicine]] / [[OncallX]] / [[UniDiag]] / [[AgentTether]] / [[LagRCA]] / CoTriage / [[OScope]] / [[PerfScout]] / [[RefinedEdge]] / LogSage / TADBench - 概念: [[ログベース障害診断]] / [[因果推論ベースRCA]] / [[マルチモーダル障害診断]] / [[オンコール自動化]] / [[時系列知識グラフ]] / [[エージェント修復]] / [[グラフベースRCA]] / [[インシデントトリアージ]] / [[知識蒸留]] / [[TSG自動化]] / [[定常性モデル]] / [[異常検知]] / [[モデル圧縮]] / [[Edge-cloud Collaboration]] / [[ログ解析]] / [[根本原因分析]]