# A Survey of Online Failure Prediction Methods ## 概要 Felix Salfner・Maren Lenk・Miroslaw Malek(Humboldt-Universität zu Berlin)による ACM Computing Surveys 42(3) 掲載のサーベイ。**古典的な信頼性工学(故障率・MTTF といった長期統計に基づく)と、実行時の監視データから「いま障害が起きそうか」を判定するオンライン障害予測とを明確に区別する**ことから出発し、後者の広い手法群を階層的な分類体系に整理する。プロアクティブ障害管理(proactive fault management)の前提技術として位置づけられ、この分野の用語規約(error / failure / fault の区別、lead time・prediction period などの時間軸)を確立した文献でもある。 > [!abstract] 概要(abstract の日本語訳) > 計算機システムの複雑さと動的性が絶え間なく増大するなかで、先回り型の障害管理(proactive fault management)は可用性を高める有効な手立てである。オンライン障害予測はそうした技術の鍵をなす。古典的な信頼性の手法とは対照的に、オンライン障害予測は実行時の監視と、システムの現在の状態および多くの場合は過去の経験をも用いる多様なモデル・手法に基づく。本サーベイはそれらの手法を記述する。この領域に関わる幅広い取り組みを捉えるため分類体系を構築し、その異なる取り組みを説明するとともに主要な概念を詳細に記述する。 ## 書誌情報 - 著者: Felix Salfner, Maren Lenk, Miroslaw Malek(Humboldt-Universität zu Berlin) - 媒体: ACM Computing Surveys 42(3), Article 10 - 発表: 2010-03 - URL: https://doi.org/10.1145/1670679.1670680 - 構成: 全 6 章(43 PDF ページ) - 原本: `.raw/theses/survey-salfner-2010-online-failure-prediction/` ## 構成と主要テーマ 本サーベイは「対象を定義する(第 1〜2 章)→ 測り方を定める(第 3 章)→ 分類体系を立てる(第 4 章)→ 体系を実例で埋める(第 5 章)→ 総括する(第 6 章)」という順で進む。**第 3 章(評価指標)を第 4 章(分類体系)より前に置く構成**が特徴で、手法を並べる前に比較の物差しを確定させている。 → [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 1 Introduction]] — 古典的な信頼性工学(設計時・長期統計)と対比してオンライン障害予測(実行時監視・短期評価)を定義し、根本原因分析との時間軸の違い(過去 対 未来)と、プロアクティブ障害管理の 4 段階枠組みを提示する。 → [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 2 Definitions]] — **fault → error(undetected / detected)→ symptom → failure** という 5 段階の連鎖と、**t_d(data window)・t_l(lead time)・t_p(prediction period)・t_w(warning time)** からなる予測の時間軸を、Avižienis ほか(2004)を出典に本論文独自の拡張として確立する。**本サーベイが後続研究に与えた最大の資産のひとつ**。 → [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 3 Evaluation Metrics]] — 混同行列を基礎に適合率・再現率・F 値・偽陽性率・特異度・NPV・正解率・オッズ比を定義し、しきい値横断の PR 曲線・ROC/AUC と、有限のテストデータからの指標推定(データ 3 分割・交差検証など)を扱う。 → [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 4 A Taxonomy of Online Failure Prediction Methods]] — **本サーベイの中核**。手法を「fault をどう可視化するか」で 4 分岐(**failure tracking / symptom monitoring / detected error reporting / undetected error auditing**)し、各枝を principal approach → category へ階層分解する。 → [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 5 Survey of Prediction Methods]] — 最長章(13 ページ)。第 4 章の分類体系を約 50 の実手法で埋める。制御理論・自然言語処理(n-gram)・生物配列解析など他分野からの技術移植が多い。 → [[@2010__ACM CSUR__A Survey of Online Failure Prediction Methods - Chapter 6 Summary and Conclusions]] — 全手法一覧(Table III、47 行)を第 4 章の枝番号と対応づけて示し、ディペンダビリティが恒久的な課題であり続ける 7 つの要因を論じて、プロアクティブ障害管理を数少ない有効策と位置づける。 ## 位置づけと影響 - **分類体系を作った側が、自ら空の枝を残している**。第 4 章が立てる 4 分岐のうち **undetected error auditing(未検知エラーの監査)には該当する研究が 1 件も無い**ことを、第 4 章と第 5 章の双方が明示する。分類が既存研究の事後的な整理ではなく、**手法空間の設計図として書かれている**ことの現れであり、この空枝は 2010 年時点の研究の偏りを示す指標にもなっている。 - **本サーベイの持続的な資産は分類そのものより用語規約である**。第 2 章が定める fault / error / symptom / failure の連鎖と 4 つの時間軸(t_d・t_l・t_p・t_w)は、以後の障害予測研究が共通の言葉で議論するための基盤になった。実際、[[A Survey of AIOps Methods for Failure Management]](Notaro ほか、2021)は用語規約の出典として本サーベイを明示的に引いている。 - **11 年後の同主題サーベイと分類の切り口が異なる**。Salfner ほか(2010)は**観測経路**(fault をどう可視化するか)で分類し、障害予測そのものを主題とする。対して Notaro ほか(2021)は**予測の対象**(hardware / system)で分類し、障害予測を AIOps の障害管理ライフサイクルの 1 カテゴリとして扱う。同じ手法群が別の軸で並べ替えられており、両者を交差させたときの空白枝の棚卸しは未実施である([[障害予測]] の未解決の問いに記録)。 - **第 3 章を第 4 章より前に置く構成が、比較可能性への意識を示している**。ただし第 6 章自身が認めるとおり、収集した約 50 手法の精度を横並びで比較することは本サーベイでは行われていない。評価の物差しを定めることと、それを使って実際に比較することの間には距離がある。 ## 関連 - 概念: [[障害予測]] / [[プロアクティブ障害管理]] / [[ディペンダビリティ]] / [[ソフトウェアエイジング]] / [[フォールトトレランス]] / [[ハードディスク信頼性]] / [[AIOps]] ## 出典 - Felix Salfner, Maren Lenk, and Miroslaw Malek, "A Survey of Online Failure Prediction Methods", *ACM Computing Surveys*, 42(3), Article 10, 2010.