# ChaosMesh Kubernetes 向けのカオスエンジニアリング / 障害注入ツール(chaos-mesh.org)。 - [[AIOpsLab]] は ChaosMesh を統合し、ネットワーク欠落・Pod 障害等の **症状的な障害**(観測可能な症状として現れる障害)をマイクロサービスに注入する。([[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]]) - AIOpsLab はこうしたカオスエンジニアリングツールが「システムの症状」しか注入できず、設定ミスやソフトウェアバグのような細粒度の根本原因をモデル化できない点を踏まえ、独自の機能的障害ライブラリで RCA・緩和の評価を補う。 - なお後続の [[SREGym]] はカオスエンジニアリングツールを「症状を注入するだけで根本原因(障害)を注入しない」として設計原則上避けており(設計の対比は [[SRE Benchmark]] 参照)、ChaosMesh の位置づけはベンチマーク間で評価が分かれる。 - [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]] は ChaosMesh で当初 31 障害種別の構造化障害空間($10^{16}$ 通り超)を実装したうえで、**注入の 84.4% が「No Anomaly」(ユーザー影響を生まない silent fault)**だったと報告する。資源障害(CPUStress/MemoryStress)はほぼ全数が強度の校正ミスで無影響(弱すぎると無反応、強すぎると OOM killer が介入)、JVM 系は対象メソッドが呼ばれず無影響。これは「カオスツールは症状しか注入しない」という SREGym/AIOpsLab の批判をさらに進め、**そもそも注入が観測可能な障害にすらならない比率が高い**ことを定量化したもの。同論文は impact-driven validation(SLI への影響で篩い分け)でこの問題に対処する([[障害注入]] に詳述)。([[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]]) ## 関連 - 本ソース: [[@2025__MLSys2025__AIOpsLab - A Holistic Framework to Evaluate AI Agents for Enabling Autonomous Clouds]] / [[@2025__arXiv__Rethinking the Evaluation of Microservice RCA with a Fault Propagation-Aware Benchmark]] - 利用するベンチマーク: [[AIOpsLab]] - 関連概念: [[障害注入]] / [[SRE Benchmark]] / [[AIOps]] / [[根本原因分析]] - 関連 MOC: [[AIOps - Failure Detection - MOC]]