# Site Reliability Engineering, 2nd Edition
## 概要
Google SRE の実践をまとめた [[SRE Book]](2016)の、10 年後の第2版。第1版が「Google の SRE とは何か、どう働くか」を説明したのに対し、第2版は分散システムの基盤技術がコモディティ化したことと、AI が変化を急加速させていることを踏まえ、第1版で薄かった社会技術的な側面(価値の示し方、組織、文化、学習)へ重心を移した。(本書 Preface)
全体の骨格は第1章が示す 6 層の「本番健全性の階層」で、Dickerson の信頼性の階層を置き換える。本書の部立てもこの階層に沿う。([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 1 Introduction - Modeling What We Do and Why]])
## 書誌情報
- **編者**: [[Betsy Beyer]], [[Chris Jones]], [[Christof Leng]], [[David Huska]], [[Jennifer Petoff]], [[Niall Murphy|Niall Richard Murphy]]
- **版**: Second Edition(第1版は [[SRE Book]])
- **出版社**: [[O'Reilly Media]]
- **発行年**: 2026(Copyright 2026 Google LLC and Niall Murphy。月日は未確認)
- **ISBN**: 979-8-341-60768-2
- **構成**: Part I〜VI、全23章 + 付録 A〜G。各章の執筆者は取り込んだ原本に記載が無い
- **URL**: https://learning.oreilly.com/library/view/site-reliability-engineering/9798341607675/
- **原本**: `.raw/books/site-reliability-engineering-2e/`(O'Reilly Learning の markdown 書き出し。序文・Foreword・各部の序論は `front/` に保存し、source ページ化していない)
## 構成と主要テーマ
### Part I: SRE in Context(第 1〜3 章)
現代の SRE を定義し、事業投資としての価値と、この 10 年の本番環境の変化を示す基礎編。
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 1 Introduction - Modeling What We Do and Why]] — SRE を「Site=なぜ・Reliability=何を・Engineering=どうやって」と定義し直し、Dickerson の階層に代わる 6 層の「本番健全性の階層」を示す導入章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 2 The Value of Reliability]] — SRE を事業投資として捉え直し、立場別の価値、信頼性を欠く 8 種のコスト、組織の成長段階別の導入パターン、導入時に自問すべき問いを整理する章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 3 Trends in Production]] — 第1版以降の 10 年で本番環境がクラウド化・ワークロード中心・セルフサービス型プラットフォームへ移ったことを整理し、Google の本番環境を事例に SRE の課題が資源割り当てからポリシーガバナンスへ移ると論じる章
### Part II: Sociotechnical Foundations(第 4〜7 章)
SRE を支える人・チーム・文化を扱う。採用と育成、組織構造、エンゲージメントモデルを含む。
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 4 The Cultural Context of SRE]] — SRE の成否を組織文化の側から論じ、信頼性重視の文化の 7 要素、DORA と Westrum による実証、「学習→自信→行動→文化」の連鎖、既存・新規システムでの導入手順を扱う章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 5 SRE Hiring, Training, and Career Management]] — SRE の成否は人に懸かるとして、採用(Treynor Curve、新卒採用)・育成(SRE EDU、ADDIE)・キャリア管理(IC の技術リーダーシップ路線、離職対策)を Google の実践から論じる章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 6 Organizational Structures for SRE]] — SRE を組織の構成単位として捉え、集中型・分散型・ハイブリッド型の得失、Spotify の分散型モデル、チーム設計、成熟度マトリクスとスコアカードによる成熟度追跡を論じる章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 7 SRE Engagement Models]] — SRE と開発の協働の契約であるエンゲージメントモデルを成熟度 3 次元とスコープ類型で整理し、PRR 中心から段階制を経て成果志向モデルへ移った Google の経緯と 3 事例を論じる章
### Part III: Situational Awareness and Continuous Preparedness(第 8〜12 章)
SLO、オブザーバビリティ、インシデント対応、障害からの学習、安全工学(STPA/CAST)という運用の実際を扱う。
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 8 Service Level Objectives]] — SLO の基礎を振り返ったうえで、導入の落とし穴、CUJ、顧客別・暗黙・クライアント側の SLO、ツールとアラートの自動構成、障害集中度、SLO モデルの弱点を論じる章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 9 Observability and Monitoring]] — 時系列中心の従来型モニタリングから、多種のシグナル・知識グラフ・CUJ 中心の顧客視点・統計的アラートで TTM を縮めるオブザーバビリティへの移行を描く章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 10 Incident Management and On-Call]] — 持続可能なオンコール設計、IRT の組織化、検知から学習までのインシデントライフサイクル、対応者の人的スキル、AI の段階的導入を論じ、Etsy の事例で「文化が先、ツールは後」を示す章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 11 Learning from Incidents]] — 非難なしのポストモーテム文化を土台に、社会技術的分析・回復的アカウンタビリティ・安全科学の理論へ進化した障害からの学習を、2023 年のパリ・データセンター障害の事例で具体化する章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 12 Safety Engineering for SRE with STPA and CAST]] — 事象の連鎖モデルに頼るポストモーテムの限界を示し、STAMP と、それに基づく先回り型の STPA・振り返り型の CAST を Google Maps の 2 事例とともに紹介する章
### Part IV: Infrastructure Design(第 13〜16 章)
自動化、テスト、キャパシティ計画、データ管理を、ソフトウェア工学の姿勢で設計する編。
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 13 Automation and Tooling]] — 自動化の動機と落とし穴を定量・定性の費用便益で比べて対象を決め、段階的に進め、トイルを測って持続可能な水準に抑え、ヒューマンファクターを踏まえて設計せよと説く実務章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 14 Testing]] — テストを「完全に正確な世界モデルの代用品」と捉え直し、ユニットテストから TiP・カナリア・DiRT・障害注入・形式手法・エージェント型テストまでを体系づけ、設定の VOIS 原則を示す章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 15 Capacity Planning]] — キャパシティ計画を需要予測と供給計画の均衡とみなし、トラフィックのタグづけ・資源プール(Flex)・取り残された容量の回収を通じて、明示したリスク許容度に基づく選択にするよう説く章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 16 Data Management]] — データ管理を法務・倫理・分類から始め、完全性・セキュリティ・可用性・効率の「データニーズの階層」と、RPO・RTO・RWO を起点にしたバックアップとリストア試験の設計へ落とす章
### Part V: Resilient Products and Emergent Reliability(第 17〜18 章)
想定外に耐える設計と、意見を持ったプラットフォームによるデフォルトによる信頼性を扱う。
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 17 Designing for Resilience]] — 信頼性とレジリエンスを区別し、リスク管理から緊急モードまでの 9 領域のレジリエンス原則を、確率と影響にもとづく投資判断と技術による既定適用で実装する方法をまとめた章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 18 Platform Engineering in SRE]] — 本番プラットフォームを「庭」から「生態系」へのアナロジーで捉え、ポリシー・ゴールデンパス・例外処理・shifting down・可読性を通じて信頼性をプラットフォームに埋め込む章
### Part VI: Outlook(第 19〜23 章)
AI による開発の加速、SRE と AI の相互支援、Google 以外の環境への適用、今後 10 年を展望する。
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 19 SRE at the Tipping Point]] — AI 駆動開発でコード生成の費用がゼロに近づき変更速度が人間の時間尺度を超えるなかで、SDLC と本番作業がどう変わるかを考え、SRE は「最後の理解者」へ向かうと論じる章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 20 How SRE Supports AI]] — SRE の使命は AI でも変わらないが、非決定的な出力と高価なアクセラレータに合わせて、品質を含む 4 本柱の SLO、適格性確認、損失フレームワークによる利用率とキャパシティ計画、電力管理、セキュリティとオブザーバビリティを作り替えよと論じる章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 21 How AI Supports SRE]] — AI を本番健全性の階層に沿って SRE に組み込む章で、透明性・文脈認識・段階的認可の安全アーキテクチャ、可逆操作の原則、Detectr と AI Operator の事例、L0〜L4 の自律性成熟度モデルを示す
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 22 SRE in Diverse Environments]] — Google 以外の多様な環境(1 人目の SRE しかいないスタートアップ、規制・レガシー・COTS に縛られた企業)で SRE を始めて根づかせる方法を、優先順位付け・漸進的標準化・周辺系への注力として示す章
→ [[@2026__OReilly__Site Reliability Engineering 2E - Chapter 23 Future of SRE]] — 信頼性の重要性と人間の関与は変わらないとしたうえで、シフトダウン、リスクを先行指標とする考え方、エージェント型本番への移行を展望する終章
### 付録 A〜G
研修投資の試算、チーム憲章の雛形と例、本番会議の議事録例、SLO 合成とレイテンシアラートの数学、統計と ML によるオブザーバビリティ。
→ [[@2026__OReilly__Site Reliability Engineering 2E - Appendix A Calculating the ROI of Training Investment]] — 年 20 人採用の仮想例で SRE 研修投資の効果を概算する付録
→ [[@2026__OReilly__Site Reliability Engineering 2E - Appendix B SRE Team Charter Template]] — SRE チーム憲章の雛形(使命・範囲・サービス・成功・価値観)を示す付録
→ [[@2026__OReilly__Site Reliability Engineering 2E - Appendix C SRE Team Charter Team Example]] — 架空の gShoe SRE チームの憲章例を示す付録
→ [[@2026__OReilly__Site Reliability Engineering 2E - Appendix D Example Production Meeting Minutes]] — カスケード障害でエラーバジェットを使い切った週の本番会議の議事録例を示す付録
→ [[@2026__OReilly__Site Reliability Engineering 2E - Appendix E The Mathematics of Composing SLOs]] — 依存先の SLO の合成(直列は成功確率の積、並列ヘッジは失敗確率の積)を扱う付録
→ [[@2026__OReilly__Site Reliability Engineering 2E - Appendix F The Mathematics of Latency Alerting]] — コホート分割と z スコアによるサービス全体の遅延劣化の検知を扱う付録
→ [[@2026__OReilly__Site Reliability Engineering 2E - Appendix G Modern Observability - Statistics and ML]] — エラー率を二項分布と Wilson 区間で扱う動的アラートと、周期的メトリクスの ML 予測を扱う付録
## 影響と位置づけ
- Foreword は、Google 全体で SRE は総エンジニア数の 4% 未満、本番作業は総エンジニア時間の 15% 未満という基準値を示し、個別チームの方針による信頼性(reliability by policy)から、共通基盤 GPP によるデフォルトによる信頼性(reliability by default)へ移った経緯(Convergence)を語る。「Google に新しい障害は無い、古い障害の新しい事例があるだけだ」という Treynor's Lament もここで紹介される。(本書 Foreword)
- デフォルトによる信頼性は本文でも繰り返し現れる主題で、プラットフォームへの信頼性の埋め込み(第18章)、PRR に代わるエンゲージメント(第7章)、シフトダウン(第23章)に通じる。
- AI については、AI 駆動開発による変更の加速(第19章)、AI 基盤を SRE が支える側(第20章)、AI が SRE を支える側(第21章)の 3 章を割く。
## 関連
- 第1版: [[SRE Book]] / 姉妹書: [[SRE Workbook]]
- 概念: [[SRE]] [[サービスレベル目標]] [[インシデント管理]] [[オブザーバビリティ]] [[AIOps]] [[クリティカルユーザージャーニー]] [[STPA]]
- 人物・組織: [[Google]] [[Ben Treynor Sloss]]
- 版間の差分: [[SRE Book は第1版から第2版で何が変わったか]]
## 出典
- Betsy Beyer, Chris Jones, Christof Leng, David Huska, Jennifer Petoff, Niall Richard Murphy (eds.), *Site Reliability Engineering*, 2nd ed., O'Reilly Media, 2026.
- 序文・Foreword・編者紹介: `.raw/books/site-reliability-engineering-2e/front/`