# Nankai University
中国・天津の研究大学(南開大学)。College of Software / Department of Software Engineering の AIOps グループ(AIOps@NKU)が異常検知・故障診断・根本原因分析・障害予測を長く牽引する。[[Shenglin Zhang]](准教授・副院長)と [[Yongqian Sun]](助教)が中核で、[[Dan Pei]] ら [[Tsinghua University]] グループと連携が深い。(Source: [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]])
- [[OptProphet]] 論文([[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]], APNet 2025)の著者全員(Sibo Xia, Long Ma, Junhua Kuang, [[Shenglin Zhang]], Qitong Xie, [[Yongqian Sun]])が同グループに連なる。
- [[SCELM]] 論文([[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]], FSE Companion '25)は [[Yongqian Sun]](第一著者)・[[Tinghua Zheng]]・[[Weihua Kuang]]・[[Shenglin Zhang]](責任著者)・[[Chao Shen]] が担った。[[BizSeer]]・CHINA TIANCHEN ENGINEERING・[[Tencent]]・[[Tsinghua University]] との産学連携作品。(Source: [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]])
- [[NexusRCL]] 論文([[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]], arXiv 2026-04)は [[Runzhou Wang]]・[[Shenglin Zhang]]・Wenwei Gu・Yongxin Zhao・Chenyu Zhao・Yuxuan Chen・Yangyuxin Huang の 7 名が同グループから参加。マイクロサービス RCL における entity-level 異質性の実証分析と異種グラフモデリング手法 NexusRCL を提案した。(Source: [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]])
- [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph|LogKG]] 論文([[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]], IEEE Transactions on Services Computing 2023)は [[Yicheng Sui]](筆頭著者)・[[Shenglin Zhang]](責任著者)を中心とする College of Software の博士課程学生と教員が開発した。ログの複数フィールドを知識グラフで統合する障害診断フレームワークで、[[Dan Pei]]([[Tsinghua University]])・China Mobile Communications Corporation との産学連携で GAIA/CMCC データセット上での評価と Guangdong Mobile の本番展開を実施した。(Source: [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]])
- [[LagRCA]] 論文([[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]], FSE Companion '26)は [[Shenglin Zhang]]・[[Junhua Kuang]]・[[Yimeng Zhang]]・[[Sibo Xia]]・[[Jintao Feng]]・[[Jingyu Wang]]・[[Wenwei Gu]]・[[Yongqian Sun]] が同グループから参加。マイクロサービス障害の伝播ラグ(D1 データセットで 81.5%のインシデントが 2 分以上の非同期ラグ)を明示的にモデル化する時空間因果推論フレームワークを提案し、Alibaba 本番環境に 3 ヶ月間デプロイして事後検証 AC@5 80%超を達成した。(Source: [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]])
- CoTriage 論文([[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]])は [[Ruowei Fu]](筆頭)・Yang Zhang・[[Shenglin Zhang]](責任著者)・Xin Wu・[[Wenwei Gu]]・Feng Wang・[[Zeyu Che]]・Xiaozhou Liu・[[Yongqian Sun]]・Yu Zhang が [[ByteDance]] と共同開発した。知識蒸留 + 自己強化 + DPO による大小モデル協調型チケットトリアージフレームワークで、同一著者陣による先行研究 [[OncallX]](fine-tuning-free な知識グラフ拡張アプローチ)とは対照的な技術路線をとる。両論文とも著者クレジットで Wenwei Gu の所属を Nankai University とする点は、[[Wenwei Gu]] エンティティページに記録した CUHK 所属説との contradiction の補強証拠となる。(Source: [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]])
- Build-bench 論文([[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]], nkcs.iops.ai 2026-05)は [[Chenyu Zhao]](筆頭)・[[Shenglin Zhang]](責任著者)・Zeshun Huang・[[Yongqian Sun]] が College of Software から参加し、[[Peking University]] の [[Weilin Jin]]、[[Tsinghua University]] の [[Dan Pei]]、[[Microsoft]] の [[Chaoyun Zhang]]・[[Qingwei Lin]]・[[Chetan Bansal]]・[[Saravan Rajmohan]]・[[Minghua Ma]] と共同開発した、クロス ISA(x86_64/aarch64)ビルド失敗の LLM 修復能力を評価する初のベンチマーク。AgentTether・PROBE と同じ著者グループが、LLM エージェント/ツール利用モデルの信頼性研究をソフトウェアビルド・パッケージング領域にも拡張した。(Source: [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]])
- InsightTriage 論文([[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]], ASE '26 投稿版)は [[Ruowei Fu]](筆頭)・[[Shenglin Zhang]](責任著者)・[[Wenwei Gu]]・[[Yongqian Sun]] が College of Software から参加し、Weiguo Li([[Huawei Technologies|Huawei Inc.]])、[[Dan Pei]]([[Tsinghua University]])と共同開発した。OncallX(ByteDance 連携)・CoTriage(ByteDance 連携)に続く、同グループによる 3 本目の「チケットトリアージ」系論文だが、本論文は唯一 Huawei との産学連携で ICV(車載)ドメインに特化する。(Source: [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]])
- OScope 論文([[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]], ICSE-SEIP '26)は [[Yongxin Zhao]](筆頭)・[[Shenglin Zhang]](責任著者)・[[Yuxin Sun]]・[[Wenwei Gu]]・[[Yongqian Sun]] が College of Software から参加し、[[Alibaba Group]] の [[Luping Wang]]・[[Li Shi]]・[[Cheng Huang]]・[[Guodong Yang]]・[[Liping Zhang]]、[[Tsinghua University]] の [[Dan Pei]] と共同開発した。マイクロサービス障害診断([[UniDiag]]・LogKG 等)を中心としてきた同グループが、OS レベルの障害診断へと研究射程を拡張した一本。Knowledge Aligner による症状記述の意味的整合と SOP ガイド逐次検証で、Alibaba 本番 101 件の OS 障害データセットにて AC@5=0.901 を達成し、3 ヶ月間・3 チームへの実デプロイで平均診断時間を約 112 分から約 1.5 分へ短縮した。(Source: [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]])
- [[PerfScout]] 論文([[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]], ICSE-SEIP '26)は [[Yongqian Sun]]・[[Shenglin Zhang]](責任著者)・Qingliang Zhang・Xiao Xiong・Mengyao Li・Yimin Zuo が College of Software から参加し、[[BizSeer]] の [[Xidao Wen]]・[[Wenwei Gu]]、[[Huawei Cloud]](成都)の Huandong Zhuang・Bowen Deng・Ruiyuan Wan、[[Tsinghua University]] の [[Dan Pei]] と共同開発した。マイクロサービス障害診断・チケットトリアージを主戦場としてきた同グループが、SPOT(極値理論ベースの動的閾値)・ADF/KPSS(局所定常性判定)・PPO(強化学習)を統合した性能テスト向け適応的ワークロード生成という新しい問題領域に展開した一本。Huawei Cloud の CodeArts PerfTest に 9 か月間本番デプロイされ、ブレークポイント特定精度 82% 超・テスト効率改善 90% 近くを達成した。同著者チームの先行研究 Auto-PIP(ISSREW 2024)の後継にあたる。(Source: [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]])
- TADBench 論文([[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]], IEEE TSC 2025)は [[Yongqian Sun]](第一著者)・Minyi Shao・Kaiwen Yang・Xingda Li・[[Bowen Hao]]・[[Shenglin Zhang]] が College of Software から参加し、Computer Network Information Center(CAS)の [[Xiaohui Nie]](対応著者)・[[Changhua Pei]]・Dongbiao He・Yanbiao Li、[[Tsinghua University]] の [[Dan Pei]] と共同開発した。5 公開トレースデータセットを統一フォーマットに標準化し 7 アルゴリズムを横断比較する初のトレース異常検知ベンチマークで、同グループの障害診断研究をログ・メトリクス中心からトレースデータへ広げた。(Source: [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]])
- RefinedEdge 論文([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]], IEEE TSC 2025)は [[Shenglin Zhang]](筆頭・責任著者)・[[Jiacheng Zhang]]・[[Shiqi Chen]]・[[Chenyu Zhao]]・[[Yutong Chen]]・[[Yongqian Sun]](corresponding author)が College of Software から参加し、[[Alibaba Cloud]] の [[Guohua Liu]]、[[Microsoft]] の [[Minghua Ma]]、[[Tsinghua University]] の [[Dan Pei]] と共同開発した。マイクロサービス障害診断・ログ解析・チケットトリアージを主戦場としてきた同グループが、多変量時系列異常検知(MTSAD)のエッジ配備向けモデル圧縮・知識蒸留・エッジクラウド協調という新しい技術領域に展開した一本。0.12M パラメータの個人化学生モデルが EdgeNode/SMD/MSL/SMAP で F1=0.9588/0.9274/0.8827/0.8580 を達成し、SMD ではパラメータ比 1.7% で 7M パラメータの Cloud-Train モデルを凌駕した。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]])
- LogSage 論文([[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]], Frontiers of Computer Science 2025)は [[Tianyu Cui]](筆頭)・[[Shenglin Zhang]](責任著者)・[[Yicheng Sui]]・[[Zeyu Che]]・[[Yongqian Sun]] が College of Software から参加し、[[ByteDance]] と共同開発した。OS カーネルパニックのログベース RCA を、教師なしクラスタリング + LLM 要約による障害指示ログ抽出(FILE)と、GraphSAGE + 能動学習によるグラフベース RCA(GARCA)の 2 段パイプラインで解き、ByteDance 本番データを含む 3 データセットで最強ベースライン LogKG を 15.5〜20.3 ポイント上回った。同グループの LogKG([[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]])が知識グラフによるログ統合であったのに対し、LogSage はグラフニューラルネットワーク表現学習という異なる技術路線をとり、ByteDance のクラウド基盤に 6 ヶ月超本番デプロイされた。(Source: [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]])
- Aloha 論文([[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]]、FSE Companion '26)は [[Shenglin Zhang]](筆頭)・[[Yujia Wu]]・[[Jinghuan Ren]]・[[Wenwei Gu]] が College of Software から参加し、責任著者 [[Yongqian Sun]] を筆頭に、[[Microsoft]] の [[Chaoyun Zhang]]・[[Liqun Li]]・[[Qingwei Lin]]・[[Dongmei Zhang]]・[[Saravan Rajmohan]]・[[Chetan Bansal]]・[[Minghua Ma]] と共同開発した。対照分析ベースの異常箇所特定([[CONAN]] の系譜)を Criterion-driven Applicability Protocol・Semantic-and-Executable Validation Toolkit・RAG-based Strategy Selection の 3 フェーズと human-in-the-loop 統合でオペレーショナル化し、Microsoft クラウドの 127 件の実バッチ障害ケースで Top-5 推薦への真の根本原因含有率 93.7%・診断時間を約 10 時間から約 0.5 時間へ短縮した。既存手法の「アルゴリズムの精緻化」ではなく「実務適用の usability gap」という新しい論点を持ち込んだ一本。(Source: [[@2026__FSE Companion__Aloha - Localizing Batch Failures in Large-scale Cloud Systems via Contrast Analysis and Human-in-the-Loop Agent]])
- OpsMem 論文([[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]], arXiv 2026-07)は [[Yongqian Sun]](第一著者)・[[Rongchen Gao]]・[[Yu Luo]]・[[Wenwei Gu]]・[[Shenglin Zhang]](責任著者)が College of Software から参加し、[[Tsinghua University]] の [[Qingyi Guo]]・[[Dan Pei]]、[[Huawei Technologies]] の [[Qiuai Fu]]・[[Yaoliang Wu]] と共同開発した。短期記憶(STM)と長期記憶(LTM)を cross-memory resonance で結合する失敗診断向けデュアルメモリフレームワークで、STM は同グループの Yu Luo が筆頭著者を務める GoS(ICML 2026)の belief-state 抽象化を踏襲する。Huawei の実運用マイクロサービス障害 120 件データセットで最強ベースライン比 Match +6.66〜25.00pt を達成した。同グループの [[OpsAgent]]・LagRCA・AgentTether・PROBE に連なる失敗診断エージェント系譜の最新作。(Source: [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]])
## 関連
- ソース: [[@2025__FCS__From Chaos to Clarity - Log-based Kernel Panic Root Cause Analysis for Large-Scale Cloud Services]] / [[@2026__arXiv__OpsMem - Dual-Memory Reasoning with Cross-Memory Resonance for Failure Diagnosis]] / [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2025__TSC__A Comprehensive Benchmark and Empirical Study of Trace Anomaly Detection]] / [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] / [[@2023__WWW__CMDiagnostor - An Ambiguity-Aware Root Cause Localization Approach Based on Call Metric Data]] / [[@2025__APNET__Forewarned is Forearmed - Joint Prediction and Classification of Optical Transceiver Failures in Large-Scale LLM Training Clusters]] / [[@2025__FSE Companion__A Multimodal Intelligent Change Assessment Framework for Microservice Systems Based on Large Language Models]] / [[@2025__KDD__FlowXpert - Expertizing Troubleshooting Workflow Orchestration with Knowledge Base and Multi-Agent Coevolution]] / [[@2026__ASE__OpsAgent - An Evolving Multi-agent System for Incident Management in Microservices]] / [[@2026__arXiv__Which Types of Heterogeneity Matter for Root Cause Localization in Microservice Systems]] / [[@2023__TSC__LogKG - Log Failure Diagnosis through Knowledge Graph]] / [[@2025__ASE__LLM-Powered Multi-Agent Collaboration for Intelligent Industrial On-Call Automation]] / [[@2026__FSE Companion__Bridging the Delay - Lag-Aware Spatio-Temporal Causal Inference for Microservice Root Cause Analysis]] / [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]] / [[@2026__nkcs.iops.ai__Can Language Models Go Beyond Coding - Assessing the Capability of Language Models to Build Real-World Systems]] / [[@2026__ICSE-SEIP__When LLMs Listen to Experts - Accurate Failure Diagnosis in Operating Systems]] / [[@2026__ICSE-SEIP__PerfScout - An Adaptive Workload Generator in Software Performance Testing]]
- エンティティ: [[Shenglin Zhang]] / [[Yongqian Sun]] / [[Ruowei Fu]] / [[Yicheng Sui]] / [[Yu Luo]] / [[Binpeng Shi]] / [[Sibo Xia]] / [[Tinghua Zheng]] / [[Weihua Kuang]] / [[Chao Shen]] / [[OptProphet]] / [[SCELM]] / [[FlowXpert]] / [[OncallX]] / [[Tsinghua University]] / [[Dan Pei]] / [[LagRCA]] / [[Junhua Kuang]] / [[Yimeng Zhang]] / [[Jintao Feng]] / [[Jingyu Wang]] / [[Wenwei Gu]] / [[Zeyu Che]] / [[Chenyu Zhao]] / [[Build-bench]] / [[Yongxin Zhao]] / [[Yuxin Sun]] / [[OScope]] / [[Xidao Wen]] / [[PerfScout]] / [[Jiacheng Zhang]] / [[Guohua Liu]] / [[Shiqi Chen]] / [[Yutong Chen]] / [[Minghua Ma]] / [[RefinedEdge]] / [[Alibaba Cloud]] / [[Tianyu Cui]] / [[ByteDance]]
- 概念: [[知識蒸留]] / [[オンコール自動化]] / [[クロスISAマイグレーション]] / [[自動ビルド修復]] / [[インシデントトリアージ]] / [[TSG自動化]] / [[定常性モデル]] / [[異常検知]] / [[モデル圧縮]] / [[Edge-cloud Collaboration]] / [[ログ解析]] / [[根本原因分析]] / [[グラフベースRCA]]