# Observability Engineering, 2nd Edition ## 概要 オブザーバビリティという分野の標準的教科書とされる書籍の第2版。初版(2022)の刊行から4年を経て、ほぼ全面的に書き直された。中心的な主張は、オブザーバビリティを「ツールの一分類」ではなく**ソフトウェアのディペンダビリティを構成する属性**として捉え直す点にある。初版が「オブザーバビリティとは何か」を業界に説得する本だったのに対し、第2版は AI 支援開発の急拡大を背景に「**本番における開発者の意図の検証**」という役割へ議論の軸足を移している。(Source: [[@2026__OReilly__Observability Engineering 2E - Chapter 1 What Is Observability?]]) 著者らは全員が [[Honeycomb.io]] に在籍または在籍経験を持つが、特定ツールの宣伝ではなく原理の提示を目的とすると明言する。第2版では13名のゲスト寄稿者を迎え、ストレージエンジン内部・モバイル・LLM・CI/CD・組織変革といった領域を各分野の実務者が担当する構成をとる。(Source: `.raw/books/observability-engineering-2e/preface.md`) ## 書誌情報 - **著者**: [[Charity Majors]], [[Liz Fong-Jones]], [[George Miranda]], with [[Austin Parker]] - **出版社**: O'Reilly Media(2026年) - **ISBN**: 978-1-098-17992-2 / Copyright 2026 Hound Technology, Inc. - **構成**: 全32章・6部構成(Part I〜VI) - **URL**: https://learning.oreilly.com/library/view/observability-engineering-2nd/9781098179915/ - **ゲスト寄稿者**: [[Jeremy Morrell]](第5・6章)、[[Boris Tane]](第10章)、[[Mat Vine]](第11章)、ClickHouse エンジニアリングチーム(第14章)、[[Mike Kelly]](第16章)、[[Frank Chen]](第17章)、[[Hugo Santos]](第18章)、[[Hanson Ho]]・[[Matt Klein]](第19章)、[[Phillip Carter]](第21章)、[[Kesha Mykhailov]](第22章)、[[Darragh Curran]](第23章)、[[Rick Clark]](第28章)、[[Hazel Weakly]](序文・第31章) - **初版との違い**: 執筆期間は初版の3年半に対し9か月。分量は約2倍でほぼ全面改稿。AI 支援開発と従来型開発の2系統のガイダンスを計装・分析の各章に併置する構成をとる ## 構成と主要テーマ 本 wiki には**第1〜32章の全32章**を取り込んだ(第27章は他章より遅れて原本が揃ったため、増分で追加した)。 Part の名称は Preface が参照する各 Part ページから確定した。章の Part への割り当ては、Preface の記述(Part I は基礎概念、Part II・III は計装と分析、Part IV は内部の深掘り、Part V はユースケース、Part VI は第23章の CTO 宛書簡から第31章の計装指針まで)と各章の内容から整理したものであり、Part II〜V の厳密な章境界は原本目次が未取得のため推定を含む。 ### Part I: Introduction to Observability(第1〜3章) オブザーバビリティの定義・系譜・位置づけを扱う基礎部。理論的起源(第1章)と実務的起源(第3章)を別々に語る構成をとる。 → [[@2026__OReilly__Observability Engineering 2E - Chapter 1 What Is Observability?]] — オブザーバビリティを制御理論(Kálmán 1960)由来の概念からディペンダビリティの第7属性として再定義し、三本柱モデルと統合ストレージモデルの対立、AI 時代の「開発者の意図の検証」という新しい役割を提示する導入章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 2 How Code Crosses Over - Validating Developer Intent in Production]] — 永続コードと使い捨てコードの区別とクリティカルパス識別を土台に、オブザーバビリティ(Practice 0)を要石として本番検証の実践群がフライホイールを成すことを論じる章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 3 The Origins of Observability in Software]] — Charity Majors が、技術的定義を与えた経緯とそれがモニタリングの再ブランディングとして空洞化していった業界史を当事者視点で回顧し、「Observability 1.0/2.0」区分を示す章 ### Part II: Instrumentation Fundamentals(第4〜7章) テレメトリをどう生成するか。構造化イベントを共通の下部構造に据え、そこから OpenTelemetry の実装へ降りていく。 → [[@2026__OReilly__Observability Engineering 2E - Chapter 4 Getting Started with Instrumentation]] — 計装の基礎(ログ・メトリクス・トレース、自動/カスタム計装の併用、計装の所有権、コストとサンプリング)を扱う入門章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 5 Structured Events Are the Building Blocks of Observability]] — メトリクス・ログ・トレースは本質的に別データ型ではなく、いずれも構造化イベントとして表現でき、事後に必要な見方を導出できることを示す章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 6 Making Structured Events Arbitrarily Wide]] — Jeremy Morrell が、構造化イベントを「任意に幅広く」計装するための6分類・22表におよぶ具体的な属性カタログを提示する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 7 Instrumenting Your Code with OpenTelemetry]] — OTel の trace-first 設計原則、スパン作成の判断基準、非 request/response 型アーキテクチャのトレース設計、eBPF による補完計装を実践的にまとめた章 ### Part III: Analysis Workflows(第8〜12章) 生成したテレメトリをどう使うか。デバッグの作法、開発プロセスへの組み込み、そして SLO によるアラーティングまで。 → [[@2026__OReilly__Observability Engineering 2E - Chapter 8 Getting Started with Observability Analysis]] — 事前知識を要さないコアアナリシスループ(仮説駆動4ステップ)と、その自動化(BubbleUp)・生成 AI エージェント活用による加速を示す章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 9 Observability-Driven Development]] — TDD が制御環境での仕様適合性検証であるのに対し、ODD は本番の可変性下での実挙動検証を担う補完的実践だと論じる章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 10 The Role of AI Agents for Observability]] — Boris Tane が、AI エージェント活用の4つの失敗モードと実証済みの3用途を整理し、成否を分けるのは一貫して運用コンテキストの質だと論じる章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 11 Using Service Level Objectives for Reliability]] — 閾値アラートがアラート疲労と逸脱の正常化を生む機序を説明し、SLO による症状ベースアラーティングへの転換を Mat Vine の ANZ Bank 事例とともに論じる章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 12 Acting On and Debugging SLO-Based Alerts]] — エラーバジェットのバーンアラートを3方式に分解し、factor of four ヒューリスティックとイベントベース SLO の優位性を通じてアクション可能な SLO アラーティングを実現する方法を論じる章 ### Part IV: Observability Technical Deep Dives(第13〜17章) 「作業を見せる」章群。ストレージエンジン内部・サンプリング・パイプライン・オントロジーと、大規模運用や自作を検討するチーム向けの深掘りが並ぶ。 → [[@2026__OReilly__Observability Engineering 2E - Chapter 13 Efficient Data Storage with Retriever]] — 時系列データベースが高カーディナリティデータに不適な理由を示し、Honeycomb の列指向エンジン Retriever の実装をケーススタディとして解説する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 14 Efficient Data Storage with ClickHouse]] — ClickHouse チーム寄稿。MergeTree の内部設計からスケーリングまでを解説し、随所で第13章 Retriever との収斂進化・設計対比に言及する章(図17点で本書最多) → [[@2026__OReilly__Observability Engineering 2E - Chapter 15 Cheap and Accurate Enough Sampling]] — サンプリングを「何を」「いつ」の2軸で整理し、一貫サンプリングとターゲットレートサンプリングという実装技法をコード例とともに提示する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 16 Telemetry Management with Pipelines]] — Mike Kelly が、収集・正規化・拡充・削減・経路制御の5段階と Agent/Gateway/Control Plane の3構成要素からなるテレメトリパイプラインを解説する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 17 Ontologies as a Shared Language for Humans and AI]] — Frank Chen が、オントロジーと不変条件を定義し「AI サンドイッチアーキテクチャ」で AI の提案を決定論的に検証してから実行する信頼性設計を示す章 ### Part V: Observability Use Cases(第18〜22章) 同じ原理をバックエンド以外の領域へ適用する応用部。CI/CD・モバイル・性能・LLM・実企業の事例が並ぶ。 → [[@2026__OReilly__Observability Engineering 2E - Chapter 18 Observability for CI-CD Pipelines]] — CI/CD パイプラインを本番と同じ厳密さで計測すべき対象と位置づけ、ワークフロー=トレース・ジョブ=スパンの写像と Honeycomb の実ビルド高速化事例で具体化する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 19 Observability for Mobile and Frontend]] — Hanson Ho と Matt Klein が、モバイル/Web 特有の制約を分析し、ローカルストレージ+リアルタイム制御プレーンという技術解と「ユーザー中心オブザーバビリティ」への転換を示す章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 20 Performance Engineering with Observability]] — Honeycomb 自身のフレームグラフ発見譚を軸に、オブザーバビリティがコスト最適化と性能改善の基盤にもなることを示し、トレーシングとプロファイリングの統合を提示する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 21 Observability for Large Language Models]] — Phillip Carter が、評価(evals)とテレメトリを統合した「学習フライホイール」でエラー率を25%から1%未満まで下げた実例を示す章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 22 Fin’s Case Study in Modern Engineering]] — Kesha Mykhailov による Fin(旧 Intercom)の一人称ケーススタディ。顧客中心信号と事業中心信号を低レベルトレースに結合することが「最後の1マイル」だと結論づける章 ### Part VI: Observability Governance(第23〜31章) 技術的意思決定者向けの部。組織図の上から下へ、CTO 宛の書簡に始まりオブザーバビリティチームの計装指針で終わる。 → [[@2026__OReilly__Observability Engineering 2E - Chapter 23 Organizational Learning Speed Is Now Your Biggest Constraint - An Open Letter to CTOs]] — Darragh Curran が、AI 時代の制約はコード生成速度ではなく組織の学習速度であり、それを引き下げるのがソシオテクニカル負債だと論じる公開書簡 → [[@2026__OReilly__Observability Engineering 2E - Chapter 24 Systems Thinking for Software Delivery]] — Trist の社会技術系同時最適化と Meadows のレバレッジポイント階層を援用し、オブザーバビリティを最も強力かつ唯一実践可能な組織変化のレバーとして位置づける章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 25 The Observability Landscape Through a Systems Lens]] — フィードバックループというレンズでツール選定を単純化し、三本柱モデル(運用向け)と統合ストレージモデル(開発者向け)を対比する橋渡し章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 26 The Business Case for Observability]] — 業務ケースは運用ループと開発者学習ループのどちらがボトルネックかの見極めから始まるとし、組織構造の転換まで提言する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 27 Diagnosing Your Observability Investment]] — 運用ループはコストセンター、開発者学習ループは戦略的投資という統治モデルの区別を軸に、投資の効き目を診断する指標群と逓減点の見極め方を示す章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 28 The Organizational Shift]] — Rick Clark が、レガシー監視の誤認を5つの診断テストで見抜き、組織免疫反応への対処とコアリション形成で変革を実現する実践的手引きを示す章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 29 Build Versus Buy (Versus Open Source)]] — build/buy/OSS 選択を資源配分の経済的判断として扱い、2×2マトリクスで技術投資を分類して「buy しつつ統合レイヤーを build する」プラットフォームモデルを推奨する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 30 The Art and Science of Vendor Partnerships]] — ベンダーエンジニアリング(非権威的な影響力行使)を軸に、信用性と信頼の区別、POC 設計、移行・脱却までを実務ガイドとして提示する章 → [[@2026__OReilly__Observability Engineering 2E - Chapter 31 Instrumentation for Observability Teams]] — Hazel Weakly と Austin Parker が、チームの北極星を「組織の構築された言語の定義・管理」に置き、セマンティック規約と規制環境での設計を論じる章 ### 結論(第32章) → [[@2026__OReilly__Observability Engineering 2E - Chapter 32 Where Do We Go From Here?]] — dev/ops の分断線の破壊を予測し、コミットメントをコードから明示的に切り出す「コードのキャッシュ化」というビジョンを歴史的先例を手がかりに提示する最終章 ## 影響と位置づけ 初版は「オブザーバビリティとは何か」という定義論争そのものを生んだ本であり、第2版はその論争の帰結を著者自身が総括している。第3章によれば、Honeycomb が与えた技術的定義は業界のマーケティングによって空洞化し、著者らは「定義の戦いに敗れた」と認めたうえで、Observability 1.0(三本柱・運用向け)と 2.0(統合ストレージ・開発者向け)という区分で再出発する。(Source: [[@2026__OReilly__Observability Engineering 2E - Chapter 3 The Origins of Observability in Software]]) 本書の技術的中核は**構造化イベント(ワイドイベント)を唯一の下部構造とし、メトリクス・ログ・トレースをそこからの導出物として扱う**という主張にある。第5章が理論的にこれを提示し、第6章が属性カタログとして、第13・14章がストレージ実装として、第19章がモバイル領域への適用として裏づける。(Source: [[@2026__OReilly__Observability Engineering 2E - Chapter 5 Structured Events Are the Building Blocks of Observability]], [[@2026__OReilly__Observability Engineering 2E - Chapter 13 Efficient Data Storage with Retriever]]) 第2版を初版から最も強く隔てるのは AI の位置づけである。AI は本書の主題ではないと明言しつつ、AI 生成コードの本番検証(第2章)、調査補助エージェント(第8・10章)、LLM アプリケーションの評価(第21章)、組織の学習速度という制約(第23章)、そしてコード自体の位置づけの変化(第32章)と、全体を貫く強制関数として扱われる。(Source: `.raw/books/observability-engineering-2e/preface.md`, [[@2026__OReilly__Observability Engineering 2E - Chapter 32 Where Do We Go From Here?]]) [[SRE Book]] が Google の運用実践を体系化した書物であるのに対し、本書は**開発者側のフィードバックループ**に軸足を置く。第25章はこの違いを「運用ループ対開発者ループ」として明示的に定式化し、大半の組織が運用ループへ過剰投資していると論じる。(Source: [[@2026__OReilly__Observability Engineering 2E - Chapter 25 The Observability Landscape Through a Systems Lens]]) ## 関連 - 人物: [[Charity Majors]] / [[Liz Fong-Jones]] / [[Austin Parker]] / [[Jeremy Morrell]] / [[Boris Tane]] / [[Frank Chen]] / [[Phillip Carter]] / [[Hazel Weakly]] / [[Darragh Curran]] / [[Rick Clark]] - 組織・製品: [[Honeycomb.io]] / [[OpenTelemetry]] / [[Retriever]] / [[ClickHouse]] / [[Bindplane]] / [[Fin]] / [[Intercom]] / [[Embrace]] - 概念: [[オブザーバビリティ]] / [[構造化イベント]] / [[テレメトリパイプライン]] / [[オブザーバビリティ駆動開発]] / [[サービスレベル目標]] / [[エラーバジェット]] / [[トレースサンプリング]] / [[ユーザー中心オブザーバビリティ]] / [[モバイルオブザーバビリティ]] / [[ソシオテクニカル負債]] / [[Build Versus Buy]] / [[ベンダーエンジニアリング]] / [[レバレッジポイント]] / [[AIサンドイッチアーキテクチャ]] / [[コードのキャッシュ化]] / [[CI-CDオブザーバビリティ]] - 関連書籍: [[SRE Book]] / [[SRE Workbook]] / [[詳解 システム・パフォーマンス 第2版]] - MOC: [[structures/SRE - MOC|SRE - MOC]] ## 出典 - Charity Majors, Liz Fong-Jones, George Miranda, with Austin Parker, *Observability Engineering*, 2nd Edition, O'Reilly Media, 2026. - 原本: `.raw/books/observability-engineering-2e/`(Preface + 31章の clean markdown、図95点)