# SRE Book は第1版から第2版で何が変わったか ## 結論 [[SRE Book]](2016、5 部 34 章 + 付録 A〜F)から [[Site Reliability Engineering 2nd Edition]](2026、6 部 23 章 + 付録 A〜G)への改訂は、差分の更新ではなく全面的な書き直しである。変化は次の 4 点に要約できる。 1. **重心の移動**: 「Google の SRE とは何か、どう働くか」の説明から、社会技術的な側面(価値の示し方、組織、文化、採用と育成)へ移った。理由は二つで、分散システムの基盤技術がコモディティ化して自作しなくなったことと、AI が変化を急加速させていることである(Preface)。 2. **枠組みの置き換え**: Dickerson の信頼性階層は 6 層の「本番健全性の階層」に、Principles / Practices / Management の部立てはこの階層に沿った 6 部構成に置き換わった(第1章)。 3. **分散システム技術章の退場**: 負荷分散、分散合意、分散 cron、データ処理パイプライン、リリースエンジニアリング、Borgmon、Auxon、Outalator といった Google 固有の基盤技術の章や事例は、後継章を持たない。 4. **新領域の追加**: AI(3 章)、STPA/CAST(1 章)、プラットフォームエンジニアリング、文化、組織構造、Google 以外の環境が新たに加わった。 一方、エラーバジェット、SLO、トイル、50% 上限、非難なしのポストモーテムといった中核の原則は残っている。ただし多くは「規則」から「文脈に合わせる目安」へ語調が柔らかくなった。 > [!note] 調べ方 > 第2版は原本(`.raw/books/site-reliability-engineering-2e/`)の全章を照合した。第1版は wiki の章別 source ページ(原本は一部章のみ `.raw/books/sre-book/` にある)で照合した。出現回数は第2版原本の grep による。行番号は `chapters/ch-NN.md:行` の形で示す。 ## 1. 書誌・編集方針の変化 | 項目 | 第1版(2016) | 第2版(2026) | |---|---|---| | 副題・問い | How Google Runs Production Systems | 副題なし。SRE の価値・組織・AI 時代の本番 | | 編者 | Beyer, Jones, Petoff, Murphy の 4 名 | 同 4 名 + Christof Leng, David Huska の 6 名(about-the-editors) | | 構成 | 5 部 34 章 + 付録 A〜F | 6 部 23 章 + 付録 A〜G | | 部立て | Introduction / Principles / Practices / Management / Conclusions | SRE in Context / Sociotechnical Foundations / Situational Awareness and Continuous Preparedness / Infrastructure Design / Resilient Products and Emergent Reliability / Outlook | | 想定読者 | 明示なし | 志望者・実務者・リーダーの 3 群と読書ガイド(Preface) | | ライセンス | sre.google で無料公開 | CC BY-NC-ND 4.0 でも公開と明記(Preface) | - 序文は技術的負債を新しい比喩に採り、SRE を「リスクのポートフォリオの管理」と位置づける。第1版の「出産と育児」の比喩は今も有効とする(Preface)。 - 序文では、platform engineering や staff engineer を同種の仕事の別名として包摂する(Preface)。 - Foreword は 10 年を総括する。SRE は総エンジニア数の 4% 未満、本番作業は総エンジニア時間の 15% 未満である。信頼性の担い手は個別チームの方針(reliability by policy)から、共通基盤によるデフォルト(reliability by default、Convergence)へ移った。Foreword は第1版冒頭の一文「systems do not run themselves」を引き、ML がこの前提を変えつつあるとも述べる(foreword.md:1-33)。 - 第1版は第2版の読書ガイドで「志望者向けの基礎教材」とされ、置き換えではなく前提として位置づけられた(Preface)。 ## 2. 全体の枠組み: 信頼性階層から本番健全性の階層へ 第1版 Part III は Dickerson の信頼性階層(モニタリング → インシデント対応 → ポストモーテム → テスト → キャパシティ計画 → 開発 → 製品)で章を並べた。第2版第1章はこの階層の限界を 3 点挙げる(事後対応に偏る、データ完全性が埋もれる、文化が暗黙のまま)。そのうえで 6 層の「本番健全性の階層」を示す。層は下から順に、社会技術的基盤、状況認識、継続的準備、インフラ設計、レジリエントな製品、創発的信頼性である。AI は階層の外に置き、全層を横断する関心事として扱う(ch-01.md:105-137, 247。[[@2026__OReilly__Site Reliability Engineering 2E - Chapter 1 Introduction - Modeling What We Do and Why]])。 第1章は SRE を Site(なぜ)・Reliability(何を)・Engineering(どうやって)に分解して定義し直す。SRE の役割は、門番ではなく信頼性を専任で代弁する支援者とされる(ch-01.md:9-41)。 ## 3. 章の対応表(第1版 34 章 → 第2版) | 第1版 | 第2版での扱い | 区分 | |---|---|---| | 1 Introduction | 第1章(再定義・新階層)、採用比率は第5章へ | 改訂 | | 2 Production Environment at Google | 第3章 Trends in Production | 全面改訂 | | 3 Embracing Risk | 第2章 The Value of Reliability、第8章 | 改訂・拡張 | | 4 SLO | 第8章 | 発展(基礎は圧縮) | | 5 Eliminating Toil | 第13章に統合、第21・22章 | 統合 | | 6 Monitoring Distributed Systems | 第9章 Observability and Monitoring | 全面改訂 | | 7 Automation at Google | 第13章、第21章 | 改訂 | | 8 Release Engineering | 独立章なし(canary は第14章、変更管理は第17章) | 分散・縮小 | | 9 Simplicity | 言及のみ | 退場 | | 10 Practical Alerting (Borgmon) | 第9章、付録 F・G(Borgmon は 0 件) | 置き換え | | 11 Being On-Call | 第10章、数値は第6章 | 改訂 | | 12 Effective Troubleshooting | 第10章の調査手法、第14章脚注 | 縮小 | | 13 Emergency Response | 第10章ライフサイクル、第17章の緊急モード | 吸収 | | 14 Managing Incidents | 第10章(IRT) | 改訂 | | 15 Postmortem Culture | 第11章、第4章、第12章 | 発展 | | 16 Tracking Outages (Outalator) | 言及なし | 退場 | | 17 Testing for Reliability | 第14章 Testing | 全面拡張 | | 18 Software Engineering in SRE (Auxon) | 言及なし(容量計画の事例は Flex へ交代) | 退場 | | 19–20 Load Balancing | Preface のリンクのみ | 退場 | | 21 Handling Overload | 第15章・第17章の節(criticality・適応スロットリングを再利用) | 吸収 | | 22 Cascading Failures | 第17章の節 | 吸収 | | 23 Distributed Consensus | Preface のリンクのみ(Paxos 1 件) | 退場 | | 24 Distributed Cron | 言及なし | 退場 | | 25 Data Processing Pipelines | 言及なし(pipeline は ML パイプラインの意味へ) | 退場 | | 26 Data Integrity | 第16章 Data Management | 全面拡張 | | 27 Reliable Product Launches (LCE) | 第7章の軽量ローンチレビューに縮小(LCE は 0 件) | 縮小 | | 28 Accelerating SRE On-Call | 第5章(SRE EDU)、Disaster Role Playing は第5・17章から参照 | 拡張 | | 29 Dealing with Interrupts | 散発的な言及 | 縮小 | | 30 Embedding an SRE | 第7章の embedded 型、第13章で誤用を警告 | 吸収 | | 31 Communication and Collaboration | 第6章、議事録例は付録 D | 分散 | | 32 Evolving Engagement Model | 第7章、第18章 | 全面改訂 | | 33 Lessons from Other Industries | 第12章(安全工学)、第22章で明示参照 | 発展 | | 34 Conclusion | 第23章 Future of SRE | 改訂 | 第2版にしか無い章は、第2・4・6・12・18〜22章と付録 A〜C・E〜G である(第2章は第1版第3章と一部重なる)。区分の線引きは章見出し・リンク・語の出現数からの判断で、原本が示した分類ではない。 ## 4. テーマ別の変更点 ### 4.1 SRE の定義・価値・文化(Part I〜II) - **価値の示し方(新規)**: 第2章は SRE を事業投資として論じる。準線形の人員スケーリング、立場別の価値、信頼性を欠く 8 種のコスト、組織の成長段階別パターンを扱う。第1版第3章の「ナイン 1 つごとにコスト約 100 倍」のような計算は見当たらない([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 2 The Value of Reliability]])。 - **本番環境(全面改訂)**: 第1版第2章の Borg・Chubby・Stubby・Shakespeare の用語解説は消えた。代わりに VM 中心からワークロード中心への移行、FinOps、ゴールデンパス、OpenTelemetry、デジタル主権、AI 需要(月 3.2 京トークン)を論じる。Google の事例は Colossus・Spanner・gRPC・Monarch・Boq へ更新された(ch-03.md:3-199。[[@2026__OReilly__Site Reliability Engineering 2E - Chapter 3 Trends in Production]])。 - **文化(新規章)**: 第4章は「5 つ目のナインは人」とし、DORA の実証と Westrum の類型を使って信頼性重視の文化を論じる([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 4 The Cultural Context of SRE]])。 - **採用・育成(拡張)**: 第1版の採用比率(SWE 50〜60%)は、SRE-SWE / SRE-SE の職務プロファイルと Treynor Curve に置き換わった。SRE EDU、新卒採用、IC キャリア、離職対策が加わった。第1版の Wheel of Misfortune は類例の一つに格下げされた(ch-05.md:41-366)。 - **組織構造(新規章)**: 第6章は、集中型・分散型・ハイブリッド型の比較、Spotify の事例、5 段階の成熟度マトリクス、スコアカードの弊害、ProdEx(2015 年以降 1,900 回超のレビュー)を扱う([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 6 Organizational Structures for SRE]])。 - **エンゲージメントモデル(全面改訂)**: 第1版第32章は PRR → 早期関与 → フレームワークの 3 段階を示した。第2版第7章は Google の経緯を、二値の PRR → Baseline / Assisted / Full の 3 階層 → 2025 年の成果志向モデル(階層を廃止)として語り直す。階層モデルの失敗要因は「誰がページャーを持つか」を軸にしたことだとし、PRR は中心から外れて道具箱の一つになった。成熟度の 3 軸(意図・影響・価値)、7 つのスコープ類型、Persistent Disk・Azure・Disney の事例が加わった(ch-07.md:41-653。[[@2026__OReilly__Site Reliability Engineering 2E - Chapter 7 SRE Engagement Models]])。 ### 4.2 数値規範の変化 | 規範 | 第1版 | 第2版 | |---|---|---| | 運用作業の上限 | 50% | 50% を維持。「上限であって目標ではない」を繰り返し強調(ch-01.md:167, ch-06.md:240) | | オンコール | 25% 以下、12 時間シフトで最大 2 件 | 25% 以下を維持(ch-06.md:240)。第10章に残るのはシフトあたり最大 2 件のみ | | チーム最小人数 | 1 拠点 8 名、2 拠点で各 6 名 | 同じ(ch-06.md:242)。理想は運用が容量の約 15% に収まること(ch-06.md:244) | | トイル | 上限 50% | 目標例は 50% → 30%(ch-13.md:366)。「健全な基準値 25%」(ch-21.md:279)。小規模組織は 80% から始まると認める(第22章) | | 信頼性作業の割合 | エラーバジェット枯渇で開発停止 | 予算の残量に応じて連続的に増える図(基準 10〜15%、枯渇時約 50%)。「推奨ではなく例示」と明記(ch-08.md:112-120) | ### 4.3 SLO(第1版第4章 → 第2版第8章) - 第2版は、第1版が SLO の普及に果たした役割を自ら評価し、SLO がオンライン版で最も参照される話題だと述べる。そのうえで基礎は短く振り返るだけにとどめる(ch-08.md:3)。 - 新たな話題は、導入の落とし穴、[[クリティカルユーザージャーニー]]に基づく SLO、B2B の顧客別 SLO、暗黙の SLO(Hyrum の法則)、クライアント側 SLO(bad minute、セッション化)、SLO Repository、アラート設定の自動生成(多窓・多バーン率に二項検定を追加)、エントロピーによる障害集中度、SLO モデルの弱点(AI 応答の成否など)である。 - **Chubby の計画停止を再評価**: 第1版の逸話は「衝撃と憤り」を招いたと認め、暗黙の SLO の問題として説明し直す。一方で、隠れた依存の抑止には成功したと併記する(ch-08.md:235)。 - 結びで「10 年でいくつかの点の見方が変わった」と明言する(ch-08.md:347。[[@2026__OReilly__Site Reliability Engineering 2E - Chapter 8 Service Level Objectives]])。 - SLO の合成の数学は付録 E として独立した。 ### 4.4 モニタリングからオブザーバビリティへ(第1版第6・10章 → 第2版第9章、付録 F・G) - 4 ゴールデンシグナルは「出発点」として 1 回言及されるだけになった(ch-09.md:25)。Borgmon は 0 件で、監視基盤の事例は Monarch と Prometheus になった。 - 第1版の「症状でアラートせよ」に、統計や ML の基準線から「その症状が重大か」を判断する層を加えた(ch-09.md:107-117)。二項分布アラート、コホート z スコアによるレイテンシアラート、周期的メトリクスの ML 予測は付録 F・G で数学的に扱われる。 - 新たな話題は、4 種のシグナル(時系列・ログ・トレース・継続プロファイリング)、知識グラフ、TTM(緩和までの時間)、高可用テレメトリと分析テレメトリの区別、OpenTelemetry、eBPF、クライアント監視(YouTube)、CUJ 中心の監視(Google Maps)、プライバシーと規制(GDPR / CCPA)である([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 9 Observability and Monitoring]])。 ### 4.5 インシデント対応とオンコール(第1版第11〜14章 → 第2版第10章) - 第1版の 4 章(オンコール、トラブルシューティング、緊急対応、インシデント管理)は 1 章に統合された。第1版第14章と Workbook 第9章は「詳述済み」として要約だけにとどめる(ch-10.md:406)。 - ICS の 4 役割の詳しい説明は無くなり、IC・通信・運用の役割を「一貫させよ」と述べるだけになった(ch-10.md:159)。IMAG という名称は第5・17・22章に出る。 - 新たな話題は、誰でも宣言できる運用と偽陽性ラベル、稼働時間帯の類型、制約ソルバによるシフト最適化、IRT(連合型の Tech IRT)、根本原因分析への批判、多仮説法、緩和優先と汎用緩和策、対応者の人的スキル、AI の段階的導入、Etsy の事例である([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 10 Incident Management and On-Call]])。第1版第12章の仮説演繹法は、多仮説法として組み直されたと読める(推測)。 ### 4.6 ポストモーテムから安全工学へ(第1版第15・33章 → 第2版第11・12章) - 第1版第15章の基礎(学習優先、非難なし、協働、経営層の支援)は「今も有効」と明言して継承する(ch-11.md:13)。 - その上に、社会技術的分析(物語化、コミュニケーション分析)、独立したポストモーテムリード、回復的アカウンタビリティ(Dekker の Just Culture に対応)、多層レビュー、安全科学の理論(スイスチーズ、Rasmussen、Safety-II、Cook、Woods、Leveson)を加えた。事例は 2023 年のパリ・データセンター障害である([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 11 Learning from Incidents]])。 - 第12章は新規章である。事象連鎖モデルと「根本原因の誘惑」を批判し、STAMP・[[STPA]]・CAST を導入する。Google Maps の 2 事例で、従来のポストモーテムより推奨事項が多く得られたと示す(STPA 34 件対 7 件、CAST 22 件対 8 件)。非難なしは「分析的でもあれ」と再定義された([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 12 Safety Engineering for SRE with STPA and CAST]])。 - 第1版第33章の「他産業からの教訓」は、第12章の安全工学と第22章の危機管理(Waymo の事例)として発展的に引き継がれた(ch-22.md:376)。 - 第1版第16章の Outalator による障害追跡は後継が無い。 ### 4.7 トイルと自動化(第1版第5・7章 → 第2版第13章、第21章) - 第2版は、第1版が定義と哲学を中心にしたのに対し、実務的な考慮を中心にしたと自ら述べる(ch-13.md:512)。 - トイルの定義: 第1章と第21章は第1版の 6 要素(手作業・反復・自動化可能・戦術的・永続的価値なし・線形増加)を引く。第13章は 4 要素(手作業・反復・線形増加・ROI が低い)に簡略化する(ch-13.md:342)。 - 自動化の段階: 第1版の 5 段階は、無・部分・完全の 3 段階に整理された。完全自動化はさらにローカル・プラットフォーム・システム固有に細分される(ch-13.md:25-60)。第21章の AI 自律度 L0〜L4 がその先に位置づく。 - 新たな話題は、費用便益の式と定量化しにくい要因、自動化の落とし穴 6 類型、Bainbridge の「自動化の皮肉」と技能の低下、トイルの類型、失敗例(緊急事態宣言やトイル専門家の指名)、ヒューマンファクターである([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 13 Automation and Tooling]])。 - 第23章は、第1版の「自分の仕事を自動化してなくせ(automate themselves out of a job)」を引き、「自動化して仕事を生み出す(into jobs)」へ反転させた(ch-23.md:55-59)。 ### 4.8 テスト(第1版第17章 → 第2版第14章) - ユニット・統合・システムテストとカナリアは継承された。第1版のカナリアの数学的扱いは参照に回した(ch-14.md:191)。 - テストは「完全な世界モデルの代用品」と捉え直された。テストピラミッドは批判的に扱われ、テスティングトロフィーが併記される。 - 新たな話題は、本番でのテスト(TiP)、設定の VOIS 原則と設定ドリフト、常時化した DiRT、クライアント視点の変更監視、障害注入、形式手法(モデル検査、定理証明)、エージェント型テストと evals である([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 14 Testing]])。 ### 4.9 容量・過負荷・レジリエンス(第1版第18〜22章 → 第2版第15・17章) - 第1版第21章の criticality とクライアント側の適応スロットリングは、リンク付きで再利用された(ch-15.md:144, 215)。カスケード障害・負荷制限・グレースフルデグラデーションは第17章の節になった。 - Auxon と意図ベースの容量計画は 0 件で、容量計画の事例は Flex(資源プール)へ交代した。性能・コスト・信頼性の「鉄の三角形」、故障ドメイン、取り残された容量の回収、COVID-19 下の Google Meet、AI 時代の供給制約が加わった([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 15 Capacity Planning]])。 - 第17章は、信頼性とレジリエンスを区別し、9 領域のレジリエンス原則と緊急モードを示す新しい統合章である([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 17 Designing for Resilience]])。 - フロントエンドとデータセンターの負荷分散(第19・20章)には後継が無い。Preface は、負荷分散や Paxos は今や自作せず買うものだと理由を述べる。 ### 4.10 データ(第1版第26章 → 第2版第16章) - 第1版の論理削除と「バックアップではなく復旧が目的」の姿勢は継承された。データ完全性は「データニーズの階層」(完全性・セキュリティ・可用性・効率)の最下層に置き直された。 - 新たな話題は、法務・倫理(年齢、保持期間、データ所在地)、データ分類、RPO・RTO・RWO を起点にしたバックアップ設計、フル・増分・差分バックアップ、Bigtable の復旧方針である([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 16 Data Management]])。 ### 4.11 プラットフォームと reliability by default(第1版第32章 → 第2版第18章) - 第1版第32章の終盤にあった「フレームワークと SRE プラットフォーム」の構想は、第2版では独立章になった。第2版は、第1版以降に Google が共通アプリケーションフレームワークへ収束したと明言する(ch-18.md:220)。 - 新たな話題は、庭から生態系へのアナロジー、ゴールデンパス・デザイアパス・ガードレール、shifting down、可読性、グリーンフィールドとブラウンフィールドでの例外管理である([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 18 Platform Engineering in SRE]])。第23章の shift down へ続く。 ### 4.12 AI(第2版で新設。Part VI) - 第19章: AI 駆動開発で変更の速度が人間の時間尺度を超え、SDLC が圧縮される。SRE は「最後の理解者」へ向かう([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 19 SRE at the Tipping Point]])。 - 第20章: SRE が AI を支える側。SLO を可用性・スループット・レイテンシ・品質の 4 本柱に分け、アクセラレータの適格性確認、損失フレームワーク、電力管理を論じる([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 20 How SRE Supports AI]])。 - 第21章: AI が SRE を支える側。本番健全性の階層に沿った AI 戦略、可逆操作の原則、エラーバジェットが尽きたら AI を助言役に格下げする仕組み、L0〜L4 の自律性成熟度、Detectr と AI Operator の事例を示す([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 21 How AI Supports SRE]])。 - 第2版原本の出現数は AI が 494、agent が 212、LLM が 34 である。他の章(第9・10・14・15・17章)にも AI の節がある。 ### 4.13 Google 以外の環境(新設。第22章) 第1版は Google 内部の記述に徹していた。第2版第22章は、1 人目の SRE しかいないスタートアップ、規制・レガシー・COTS に縛られた企業、金融・住宅ローン業界、CrowdStrike 障害や Log4j を扱う([[@2026__OReilly__Site Reliability Engineering 2E - Chapter 22 SRE in Diverse Environments]])。第2版には、第1版の [[SRE Workbook]] が担った「Google 外への適用」を本編へ取り込んだ面がある(推測)。 ## 5. 付録の変化 | 第1版 | 第2版 | |---|---| | A 可用性表 | 独立付録なし(ナインは第8章本文で扱う) | | B ベストプラクティス集 | 第14章から参照のみ | | C インシデント状態文書の例 | なし | | D ポストモーテムの例 | なし(未確認) | | E ローンチ調整チェックリスト | なし | | F 本番会議議事録の例 | 付録 D としてほぼ流用(2015-10-21 付の同じ例) | | — | 新規: A 研修投資の ROI、B・C チーム憲章の雛形と例、E SLO 合成の数学、F レイテンシアラートの数学、G 統計と ML によるオブザーバビリティ | 付録の性格は、運用文書の例から、組織運営の道具と数学的な補遺へ移った。 ## 6. 変わらなかったもの Preface は、変わらないものとして「SRE はエンジニアであり、大規模分散サービスの信頼性に集中する」ことを挙げる。第23章は、信頼性の重要性と人間の関与は変わらないとする。具体的に残った原則は次のとおりである。 - 100% を目標にしないこととエラーバジェット(error budget は 82 回出現) - SLO / SLI を共通言語とすること(SLO は 507 回出現) - 運用 50% 上限・オンコール 25% 上限・チーム最小人数 - 非難なしのポストモーテム(blameless は 73 回出現) - DiRT と Disaster Role Playing - 「Hope is not a strategy」(3 回出現) ## 7. 未確認点 - 第1版の付録 D(ポストモーテム例)が第2版のどこかに移ったかは照合していない。 - 第2版の付録 D にある「Toil Check」節が第2版での追加かどうかは、第1版付録 F の原本が `.raw` に無いため照合できていない。 - 第7章脚注 5 は「*The Site Reliability Workbook* の第32章」と書くが、リンク先は第1版第32章である(ch-07.md:678)。原本側の表記の揺れとみられる。