# Stratus
現代クラウドの自律的な信頼性運用のためのマルチエージェントシステム(SRE エージェント)。一次論文は [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]]([[Yinfang Chen]] ほか, NeurIPS'25; arXiv:2506.02009)。
## 一次論文(STRATUS, NeurIPS'25)による記述(PDF 本文参照)
- **アーキテクチャ**: 4 エージェント — αD(検知)・αG(診断: 箇所特定+RCA)・αM(緩和)・αU(巻き戻し)— を**決定的な状態機械(コントロールプレーン)**で編成し、LLM は各エージェントのデータフローにのみ使う。読み取り専用 `Aread` / 変更 `Awrite` / 巻き戻し `Aundo` の行動空間を ACI(Agent-Computer Interface)経由で操作。実装基盤は [[CrewAI]]。(Source: [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]] §3–4)
- **安全仕様 [[Transactional No-Regression]] (TNR)**: 重大度指標 `µ(s)=w1·|A|+w2·|V|+w3·|L|` の単調非増加(`µ(s) ≤ b`)を、A-Lock(ライタ排他)/Faithful Undo(`U(spost)=spre`)/Bounded Risk Window(`K=20`)の 3 仮定下で Alpern–Schneider の safety property として証明(Lemma 3.1)。Undo Agent は状態突き合わせを使った**スタックベースのロールバック**(Figure 3)で実装。
- **性能**: [[AIOpsLab]] の緩和 69.2%(9/13)・[[ITBench]] 50.0%(9/18)で 2 位を **1.5X / 5.4X** 上回る(GPT-4o)。アブレーションでは再試行なしで 15.4% まで落ち、TNR の巻き戻しと再試行が緩和の鍵だと示す(80% 超の問題で 1 回以上再試行)。検知 90.6%・箇所特定 51.2%(最高)。(Table 2/3/4)
- **現実性の留保**: ITBench 18 問中 8 問は「注入した障害が Pod 再起動後に残らない」性質を悪用した Pod 再起動で解いており、永続的な障害には効かないと論文自身が明言。
- 著者 10 名(共著代表 4 名): [[Yinfang Chen]], Jiaqi Pan, Jackson Clark, Yiming Su(以上 [[University of Illinois Urbana-Champaign]]、Pan は [[Tsinghua University]] 兼)/ Noah Zheutlin, Bhavya Bhavya, Rohan Arora, Yu Deng, [[Saurabh Jha]](以上 [[IBM Research]])/ [[Tianyin Xu]](UIUC)。
## 博士論文第4章による再録(§4、拡張版)
[[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 4 A Multi-Agent System for Autonomous Site Reliability Engineering]](Yinfang Chen 博士論文、UIUC、2026)は一次論文(NeurIPS'25)の拡張版で、TNR の形式定義・4エージェント構成・評価ベンチマーク(AIOpsLab/ITBench)・成功率(69.2%・50.0%)・コスト・比較対象の baseline は一次論文と語句レベルで一致し、矛盾は見つからなかった。拡張分は次の3点。
- **task-based 対 role-based の定量比較**: AutoGen による role-based 設計(Application Developer/Platform Engineer/System Administrator/Team Manager のロールで会話するエージェント)を AIOpsLab 48 問のサンプルで評価したところ 10 問しか解けず、単純な検知問題ですら 893 秒(STRATUS の 25 倍)を要した。原因は各エージェントが部分的なシステム観のまま過剰に対話し、ラウンドロビン方式の話者選択が毎ステップ全エージェントを発言させ冗長なテレメトリ再検証を招いたこと。STRATUS の task-based(状態機械 + 専門エージェント)設計を実証的に正当化する。
- **エージェント封じ込めルールの詳細(Table 13)**: role-based ルール(Read-Only Agents はコマンド、Writer Agents は直列実行のみ)に加え、command-level で全エージェント共通に禁止する10種のルール(名前空間削除・`kubectl exec -it`/`edit` 等の対話コマンド・入力元 stdin・シェルパイプ/複合コマンド/コマンド置換/フロー制御/シェル関数)を規定する。
- **複数の相互依存障害への拡張実験**: 3ノードのクォーラムシステム(leader 1・follower 2)に follower のデータ破損と leader のクラッシュを同時注入する新規実験(既存2ベンチマークに存在しない設定)を追加。STRATUS は follower のボリュームを根本原因として箇所特定できず leader の再起動のみを繰り返して緩和に失敗したが、TNR は機能し続けシステムをさらに悪化させずに安全に再試行を続けた。
## SREGym 評価(二次情報)による観測
- 評価では Claude Sonnet-4.6 / Kimi K2.5 を載せて測定。Sonnet-4.6 版は全エージェント中で緩和成功率が最高で、これは**巻き戻しと再試行の機構**に起因する(一次論文の [[Transactional No-Regression]] と整合)。Kimi K2.5 版は素のモデル能力の制約で最低。([[@2026__arXiv__SREGym - A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios]])
- オブザーバビリティデータを前処理し関連データのみを LLM に渡すため、汎用のコーディングエージェント(Claude Code・Codex)より 1 実行あたりのトークン消費が約 1/3。メトリクス/トレース/サービス依存グラフ用の専用 API ツールを持ち、ツール呼び出しの 15–17% を占める。
- 緩和の書き込み操作では `kubectl patch`(39–41%)を好む。
## 関連
- 一次ソース: [[@2025__NeurIPS2025__STRATUS - A Multi-agent System for Autonomous Reliability Engineering of Modern Clouds]] / [[@2026__PhD__Agentic Failure Management of Cloud Systems - Chapter 4 A Multi-Agent System for Autonomous Site Reliability Engineering]](拡張版)
- 評価で使われた論文: [[@2026__arXiv__SREGym - A Live Benchmark for AI SRE Agents with High-Fidelity Failure Scenarios]]
- 概念: [[Transactional No-Regression]] / [[agentic SRE]] / [[SRE Benchmark]]
- 評価ベンチマーク: [[AIOpsLab]] / [[ITBench]]
- 著者: [[Yinfang Chen]] / [[Tianyin Xu]] / [[Saurabh Jha]]
- 所属・基盤: [[University of Illinois Urbana-Champaign]] / [[IBM Research]] / [[Tsinghua University]] / [[CrewAI]]
- 関連 MOC: [[LLM4SRE - MOC]] / [[Project AI4SRE - MOC]]