# OpsLLM [[Sun Yat-sen University]] と [[Alibaba Cloud]] の共同研究([[Jingkai He]]・[[Pengfei Chen]] ほか)が開発した、ソフトウェア運用ドメイン特化 LLM。知識ベース QA と根本原因分析(RCA、[[LLMによる根本原因分析]])の両方をサポートする。Qwen2.5 の 7B/14B/32B をベースに、LoRA による SFT と、ドメインプロセス報酬モデル(DPRM)を用いた段階ゲート型 GRPO([[GRPO]]、[[VeRL]] 上で実装)による強化学習の 2 段階で構築される。コード: https://github.com/IntelligentDDS/OpsLLM(Source: [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]]) ## 訓練データ 15K サンプルのファインチューニングデータセット(観測性データ由来 596 件 + テキスト運用知識由来 14,431 件)を Human-in-the-Loop でキュレーションして構築。観測性データは Chaos Mesh([[障害注入]])による Online Boutique への障害注入から生成する。 ## 評価結果 QA タスクで既存 LLM に対し 0.2%〜11.9%、RCA タスクで 8.5%〜70.3% の精度改善を達成(いずれも Easy/Mid/Hard の3難易度評価)。OpsLLM-32B は QA Hard(OpsEval)で 88.7%、RCA の全難易度で最高精度(77.4/79.0/32.3%)を記録し、Train Ticket への zero-shot 転移(OpsLLM-14B、32%)でも既存 LLM を上回った。 ## 関連 - ソース: [[@2026__arXiv__OpsLLM - Construction of Large Language Model for Software Operations with Multi-stage Learning]] - 開発元: [[Sun Yat-sen University]] / [[Alibaba Cloud]] - 開発者: [[Jingkai He]] / [[Pengfei Chen]] / [[Chenghui Wu]] / [[Shuang Liang]] / [[Ye Li]] / [[Gou Tan]] / [[Xidao Wen]] / [[Chuanfu Zhang]] / [[Fang Situ]] / [[Qi Zhou]] - 使用技術: [[GRPO]] / [[VeRL]] / Qwen2.5(ベースモデル) - 概念: [[LLMによる根本原因分析]] / [[検証可能報酬による強化学習]] / [[障害注入]] / [[AIOps]] / [[報酬ハッキング]]