# Niall Murphy ## 概要 [[Google]] の SRE であり、[[SRE Book]](2016)の 4 名の共同編者の一人である。同書では編者としての役割に加え、第 7 章(自動化)の著者として Google における自動化の進化を詳述した。 ## 主要な貢献 ### SRE Book の共同編集(2016) [[Betsy Beyer]]、Chris Jones、Jennifer Petoff とともに "Site Reliability Engineering: How Google Runs Production Systems" の編集に携わった。SRE 実務者としての経験を編集方針に反映し、理論と実践の架橋を実現した。 → [[SRE Book]] ### 第 7 章: The Evolution of Automation at Google John Looney、Michael Kacirek との共著で、Google における自動化の 5 段階モデルと 3 つの主要事例(MySQL の Borg 移行、クラスタターンアップ、Borg クラスタ管理)を執筆した。手作業の単純な自動化ではなく、明確な API を備えた耐障害システムの構築が本質であるという教訓を導いた。 → [[@2016__OReilly__SRE Book - Chapter 7 Automation at Google]] ### The Site Reliability Workbook の共同編集(2018) SRE Book の実践的コンパニオン書籍 "The Site Reliability Workbook" の共同編者を務めた。 ### 第 4 章: SLO(共著) SRE Book 第 4 章のサービスレベル目標に関する議論にも貢献している。 → [[@2016__OReilly__SRE Book - Chapter 4 Service Level Objectives]] / [[サービスレベル目標]] ### SREcon16 発表(2016 年 4 月) [[Chris Jones]] と共同で SREcon16(Santa Clara)にて "Service Levels and Error Budgets" を口頭発表した。当時 Google Dublin の Ads SRE リード(約 70〜80 名規模)。SLI/SLO/SLA の三概念の区別、エラーバジェットを制御ループとして使う考え方、SRE と開発チームの関係の健全化を実演的に解説した。SRE Book 第 4 章の共著者群(Chris Jones・[[John Wilkes]]・Cody Smith・Niall Murphy)のうち本人と Jones が登壇した。 → [[@2016__SREcon16__Service Levels and Error Budgets]] ## 自動化に対する視座 Murphy は第 7 章において、自動化を単なる効率化手段ではなくシステム設計の本質的構成要素として位置づけた。特に段階 3(外部管理のシステム固有自動化)から段階 4(内部管理のシステム固有自動化)への移行が質的転換であると論じた点は、[[自動化のアイロニー]](Bainbridge, 1983)で指摘された自動化の逆説的課題への実践的な回答となっている。 ### 『SLO サービスレベル目標』第 8 章「SLOの監視とアラート」の執筆(原著2020/日本語版2023) Alex Hidalgo の *Implementing Service Level Objectives* 第 8 章を単独で執筆した。単純な閾値ベースのアラートの構造的欠陥(閾値の妥当性低下・ユーザー体験の不完全な代用物・戦場の霧)を論じたうえで、エラーバジェットのバーンレートに基づくファストバーン/スローバーンの複数ウィンドウアラート設計を提示した。Rob Ewaschuk の "My Philosophy on Alerting" と、その続編である Štěpán Davidovič・Betsy Beyer の "Reduce Toil Through Better Alerting" を、SLO アラートの原理を要約する典拠として明示的に引用している。 → [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 8 SLOの監視とアラート]] / [[エラーバジェット]] ### 『SREの探求』第19章への協力(2021、Microsoft在籍時) David N. Blank-Edelman(編)『SREの探求』第19章「ドキュメント作成業務の改善」の執筆協力者として、Ríona MacNamara・Shylaja Nukala(以上Google)、Stas Miasnikoŭ・Aaron Gillies・Jeremy Sharpe(以上Google)と共に名前が挙がっている。同章の著者紹介では、Murphyはインターネットインフラストラクチャ分野で20年を超える経験を持ち、[[Microsoft]] ダブリン支社の Software Engineering for Azure Production Infrastructure Engineering 部門ディレクターとして紹介されている。企業創業者・著者・写真家でもあり、コンピュータサイエンス・数学・詩学の学位を持つ。SRE Book および The Site Reliability Workbook(いずれもオライリー)の発起人・共著者・編集者とも紹介されている。 → [[@2021__OReillyJapan__SREの探求 - Chapter 19 ドキュメント作成業務の改善:エンジニアリングワークフローへのドキュメンテーションの統合]] ### 『SREをはじめよう』第9章の技術レビュアーとしての貢献 David N. Blank-Edelman は『SREをはじめよう』第9章「トイルとの関係を築く」の技術レビュアーとして Murphy を挙げている。Murphy は同章で示された「トイルは(いかなる場合も)創造も破壊もできず、変形できるだけだ」という「トイルの保存」の主張に同意せず、「根本的な設計の選択と変更によってはトイルの創造・破壊が可能である」という例外を指摘し、主張を「根本的な設計の選択と変更以外では創造も破壊もできない」と言い換えるべきだと提案した。また別の脚注では、すべての顧客がトイル削減の価値を著者と同じように認識するとは限らず、「手作業をこなすのが得意でコーディングが苦手な」チームにとってはトレードオフの見方が異なりうる、とも指摘している。 → [[@2024__OReillyJapan__SREをはじめよう - Chapter 9 トイルとの関係を築く]] / [[トイル]] ### 『SREの探求』第30章「オンコール反対論」の単独著者(2021、Microsoft在籍時) David N. Blank-Edelman(編)『SREの探求』第30章「オンコール反対論」を単独で執筆した。オンコールという慣行そのものへの反対論を展開し、オンコールを行う根拠を「既知の既知」「既知の未知」「未知の未知」「プロダクションの知恵」の4カテゴリに分類したうえで、唯一正当なのは「プロダクションの知恵」だけだと主張した。ヒューマンエラー研究・認知バイアス研究を引いて人間はストレス下でパフォーマンスが著しく劣化すると論じ、根本的な解決策として「強いオンコール反対(SAOC)」「弱いオンコール反対(WAOC)」という2つの立場を提示し、両者とも標準化されたツールキットソフトウェアという同じ処方箋に収束すると結論づけた。著者紹介では、インターネットインフラストラクチャ分野で20年を超える経験を持ち、Microsoft ダブリン支社の Software Engineering for Azure Production Infrastructure Engineering 部門ディレクターとして紹介されている(第19章の著者紹介と同一の肩書)。 → [[@2021__OReillyJapan__SREの探求 - Chapter 30 オンコール反対論]] / [[オンコール]] / [[オンコールストレス管理]] ### 『信頼性の高い機械学習』第9章「モデルの監視と可観測性」の共著(原著2022/日本語版2024) [[Aparna Dhinakaran]] と共同で第9章を執筆した。監視をモデル・データ・サービスの3レイヤーに分けて捉える枠組み、訓練運用間スキュー、実績値(グランドトゥルース)取得可否に応じた4ケースの監視戦略の分岐、ドリフト(特徴量/モデル/コンセプト)とデータ品質チェックの区別、MLのSLOに固有の考慮点(データの分布・鮮度を範囲に含める必要性)などを体系化した。SRE Book由来のゴールデンシグナル(レイテンシ・トラフィック・エラー・飽和)やSLO実践を、ML運用監視の文脈へ具体的に拡張している章であり、著者自身のSRE経験([[SRE Book]]・[[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 8 SLOの監視とアラート]])が地続きで反映されている。 → [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 9 モデルの監視と可観測性]] / [[MLモデル監視]] ## 関連 - [[@2024__OReillyJapan__信頼性の高い機械学習 - Chapter 9 モデルの監視と可観測性]]: 共著者として執筆した章(モデルの監視と可観測性) - [[信頼性の高い機械学習]]: 著者の一人として名を連ねる書籍 - [[Aparna Dhinakaran]]: 9章の共著者 - [[@2021__OReillyJapan__SREの探求 - Chapter 30 オンコール反対論]]: 単独著者として執筆した章(オンコール反対論) - [[@2021__OReillyJapan__SREの探求 - Chapter 19 ドキュメント作成業務の改善:エンジニアリングワークフローへのドキュメンテーションの統合]]: 執筆協力者として名前が挙がる章(Microsoft在籍時) - [[Microsoft]]: 現在の所属組織 - [[SRE Book]]: 共同編集書籍 - [[@2016__OReilly__SRE Book - Chapter 7 Automation at Google]]: 著者として執筆した章 - [[@2016__OReilly__SRE Book - Chapter 4 Service Level Objectives]]: 共著章 - [[@2016__OReilly__SRE Book - Part III Practices]]: 編者として統括した実践体系 - [[@2016__SREcon16__Service Levels and Error Budgets]]: SREcon16 口頭発表 - [[@2024__OReillyJapan__SREをはじめよう - Chapter 9 トイルとの関係を築く]]: 技術レビュアーとしてトイルの保存の主張に異を唱えた章 - [[@2023__OReillyJapan__SLO サービスレベル目標 - Chapter 8 SLOの監視とアラート]]: 単独著者として執筆した章 - [[Chris Jones]]: SREcon16 共同登壇者 - [[Betsy Beyer]]: 共同編者 - [[Google]]: 所属組織 - [[自動化のアイロニー]]: 自動化の逆説的課題との接続 - [[トイル]]: レビュアーとして議論に関わった概念 - [[エラーバジェット]]: バーンレートアラートの議論と接続 ## 出典 - Niall Richard Murphy, 「オンコール反対論」, David N. Blank-Edelman(編)『SREの探求』, オライリー・ジャパン, 2021, 30章. - Ríona MacNamara、Shylaja Nukala 他, 「ドキュメント作成業務の改善:エンジニアリングワークフローへのドキュメンテーションの統合」, David N. Blank-Edelman(編)『SREの探求』, オライリー・ジャパン, 2021, 19章(執筆協力者). - Niall Murphy, John Looney, Michael Kacirek, "The Evolution of Automation at Google," in *Site Reliability Engineering*, O'Reilly, 2016 - Chris Jones and Niall Murphy, "Service Levels and Error Budgets," SREcon16, Santa Clara, April 2016 - David N. Blank-Edelman(山口能迪 訳), 『SREをはじめよう』, オライリー・ジャパン, 2024, 9章(技術レビュアー). - Alex Hidalgo(著者 Niall Murphy 執筆、山口能迪 監訳), 『SLO サービスレベル目標』, オライリー・ジャパン, 2023, 8章. - Cathy Chen, Niall Richard Murphy, Kranti Parisa, D. Sculley, Todd Underwood, 井伊篤彦・張凡・樋口千洋訳, 『信頼性の高い機械学習 ―SRE 原則を活用した MLOps』, オライリー・ジャパン, 2024, 9章(共著: Aparna Dhinakaran).