# Kubernetes クラウドネイティブ基盤のデファクトなコンテナオーケストレータ(K8s)。複雑な分散コントロールプレーンを持つ一方、標準化されたドキュメント群を備える。(Source: [[@2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems]]) - [[Cloud-OpsBench]] は Kubernetes(v1.31、Huawei Cloud ECS 上の 4 インスタンス)を対象スタックに選ぶ。複雑な障害注入の余地と標準化された文書コーパスを併せ持つため、知識基盤型推論(knowledge-grounded reasoning)を厳密に検証でき、独自・難解なシステムに基づくベンチとの差別化点となる。 - 同ベンチの 40 の根本原因種別は Kubernetes 全スタックを覆う(Admission Control・Scheduling・Startup・Runtime・Service Routing・Performance・Infrastructure の 7 カテゴリ、表2)。State Snapshot はコントロールプレーン設定(マニフェスト)とデータプレーン状態(Pod 一覧)を凍結し、`kubectl` 互換のモック接面で再生する。 - [[Datadog]] は親クラスタ(コントロールプレーンを素の VM 群として稼働)と子クラスタ(実ワークロード。子クラスタのコントロールプレーンは親クラスタ上の Pod として稼働)という二層構造を運用する。2023年3月8日の大規模障害では、systemd/networkd の経路フラッシュで Pod ネットワーキングが全断し、親クラスタ→子クラスタのコントロールプレーン→実ワークロードノードの順で復旧する必要があった。(Source: [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]]) - [[Red Hat OpenShift]] は Kubernetes を拡張した企業向けディストリビューションであり、[[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]] は OpenShift 上に ReAct ベースの LLM エージェントを統合し、Kubernetes API・[[Prometheus]] メトリクスへのアクセスを通じて IT オペレーション支援を行う産業経験報告を発表した。 ## 関連 - 本ソース: [[@2026__arXiv__Cloud-OpsBench - A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems]] / [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]] / [[@2026__FSE Companion__LLM Agents for AIOps in Kubernetes - An Industrial Experience Report with Red Hat OpenShift]] - 利用ベンチ: [[Cloud-OpsBench]] - 関連システム: [[Online-Boutique]](K8s 上のマイクロサービスデモ) / [[ChaosMesh]] / [[Red Hat OpenShift]] - 関連組織: [[Datadog]] / [[Red Hat]] - 関連概念: [[根本原因分析]] / [[AIOps]] / [[障害注入]] / [[インシデント管理]] / [[ReAct]]