# Anatomy of an Incident ## 概要 Google の SRE が、本番サービスにおけるインシデント管理の考え方と実践を 7 章 70 ページにまとめた O'Reilly レポート(2022 年 1 月刊)。インシデント管理を「準備(preparedness)→ 対応(response)→ 緩和と復旧(mitigation and recovery)」の循環するライフサイクルとして提示し、その各段階に Google 社内の具体的な仕組み(災害ロールプレイング、system-of-system 応答者、ICS 変種、ポストモーテム)を対応づける。 ## 書誌情報 - 書名: *Anatomy of an Incident: Google's Approach to Incident Management for Production Services* - 著者: [[Ayelet Sachto]], [[Adrienne Walcer]](with [[Jessie Yang]]) - 出版社: O'Reilly Media, Inc.(Google との共同企画。編集上の独立性に関する声明つき) - 発行: 2022 年 1 月(First Edition、初版リリース 2022-01-24) - 構成: 全 7 章 / 70 ページ - 形態: 無償配布レポート(Compliments of Google) - URL: https://sre.google ## 構成と主要テーマ 全 7 章。第 1 章で提示されるインシデント管理ライフサイクル(準備 → 対応 → 緩和と復旧)に第 2〜4 章が順に対応し、第 5 章がそれを次の周回へ接続するポストモーテムを担う。第 6 章が全体を 1 つの実例で束ね、第 7 章で締める。 ### 導入(第 1 章) インシデントとは何か、モニタリング・アラートと何が違うかを定義し、本書全体の枠組みとなるライフサイクルを提示する。 → [[@2022__OReilly__Anatomy of an Incident - Chapter 1 Introduction]] — Google 実務者が「エスカレーション・即時対応・組織的対応」の 3 条件でインシデントを定義し、モニタリング/アラート/インシデントを峻別したうえで、準備・対応・緩和と復旧の 3 段階が円環をなすライフサイクルを提示する導入章。 ### 準備(第 2 章) インシデントが起きる前に何を練習しておくか。 → [[@2022__OReilly__Anatomy of an Incident - Chapter 2 Practicing Incident Response Readiness (Preparedness)]] — Google の DiRT プログラムと Wheel of Misfortune による災害ロールプレイングを軸に、定期的なインシデント対応テストが応答者の技術的・精神的準備を高める経緯と、直近のポストモーテムの 3 標準質問を起点にテストを段階的に設計する具体的手順を示す。 ### 対応(第 3 章) インシデント対応を組織としてスケールさせる構造。 → [[@2022__OReilly__Anatomy of an Incident - Chapter 3 Scaling Incident Management (Response)]] — コンポーネント応答者と system-of-system 応答者(プロダクト特化 IRT・Tech IRT)という二層エスカレーション組織と、それを支える共通プロトコル・信頼・敬意・透明性の 4 特性、重大度 6 区分、3 日以内という対応期間ポリシーを提示する、本書で最も組織論的な章。 ### 緩和と復旧(第 4 章) インシデントの影響をどう定量化し、どう減らすか。 → [[@2022__OReilly__Anatomy of an Incident - Chapter 4 Mitigation and Recovery]] — 不信頼性 = Σ(TTD+TTR)/TBF × Impact という式を軸に、検知までの時間の短縮・修復までの時間の短縮・障害間隔の延伸という 3 方向の改善策(アラート設計、ICS/IMAG による組織的対応、N+2 冗長化・多重防御・グレースフルデグレーデーション等の設計時投資)を論じる、本書で最も定量的な章。 ### 学習(第 5 章) インシデントを次の周回の準備へ変換する仕組み。 → [[@2022__OReilly__Anatomy of an Incident - Chapter 5 Postmortems and Beyond]] — 心理的安全性(導入時・対応中・組織全体の 3 層)とポストモーテム執筆(システム分析としての 3 円ベン図モデル、根本原因対トリガー、孤立システム対全体スタック、時点対軌跡)の 2 本柱を論じ、非難のない文化と分析の深さが将来のインシデント削減を左右すると説く。本書で最も分量が多い章。 ### 実例と結び(第 6〜7 章) → [[@2022__OReilly__Anatomy of an Incident - Chapter 6 The Mayan Apocalypse - A Real-World Example]] — Google 社内で「Mayan Apocalypse」と呼ばれた 2019 年 6 月 2 日の実インシデント(ネットワーク自動化ツール Maya の誤フラグに端を発するカスケード障害)を時系列で描き、40 人超が参加しても並列化が緩和を加速しない構造、対象コンポーネント未経験の Tech IRT メンバーがインシデントコマンダーとして機能した経過、緩和・クローズ・ポストモーテム・報酬設計までを一続きの実例として示す。 → [[@2022__OReilly__Anatomy of an Incident - Chapter 7 Conclusion and Moving Forward]] — 「インシデント管理は適切な場面でのみ使い、ヒーロイズムでなくチーム全体の継続改善と非難のなさで臨むべき」という行動喚起を述べ、Additional Reading・Bibliography・謝辞・著者紹介で締めくくる。 ## 影響と位置づけ - [[SRE Book]] / SRE Workbook が扱うインシデント管理の各論を、**1 つのライフサイクルに束ねた入門**として位置づけられる。第 7 章の Additional Reading も SRE Workbook の Monitoring / Incident Response / Postmortem Culture 各章を挙げている。 - Google 内部の具体的な仕組み(DiRT、Wheel of Misfortune、FEMA ICS の内部変種、Tech IRT、重大度 6 区分)を名指しで公開している点が、抽象論に留まりがちなインシデント管理文献のなかでの本書の価値である。 - 第 4 章の不信頼性 = Σ(TTD+TTR)/TBF × Impact は、インシデント対応の投資判断を 3 つの操作変数に分解する枠組みとして、[[インシデントメトリクス]] や [[インシデント影響測定]] の議論と接続する。 - 70 ページの無償レポートであり、体系書ではなく**実務者向けの見取り図**として書かれている。個々の論点の深さは専門文献に譲る。 ## 関連 - 概念: [[インシデント管理]] / [[Incident Commander]] / [[インシデント重大度評価]] / [[インシデントメトリクス]] / [[インシデント影響測定]] / [[障害緩和]] / [[クラウド障害ライフサイクル]] / [[ポストモーテム]] / [[心理的安全性]] / [[根本原因分析]] / [[複雑システム障害論]] / [[GameDay]] / [[カオスエンジニアリング]] / [[組織の信頼性マインドセット]] - 実体: [[Ayelet Sachto]] / [[Adrienne Walcer]] / [[Jessie Yang]] / [[Google]] / [[Ben Treynor Sloss]] - 関連書籍: [[SRE Book]] ## 出典 - Ayelet Sachto and Adrienne Walcer, with Jessie Yang, *Anatomy of an Incident: Google's Approach to Incident Management for Production Services*, O'Reilly Media, 2022. - 原本: `.raw/books/anatomy-of-an-incident/` - Ayelet Sachto and Adrienne Walcer, with Jessie Yang, *Anatomy of an Incident: Google's Approach to Incident Management for Production Services*, O'Reilly Media, 2022.