# アラートランキング ## 定義 アラートランキング(Alert Ranking)は、多数発火するアラートを「真陽性確率」「重要度」「アクショナビリティ」等の基準で順序付けて OCE に呈示し、対応すべきアラートを最初に分析できるようにする技術。[[アラート管理]] の 5 介入点(抑制/フィルタリング/集約/ランキング/RCA)の 4 番目に位置する。ランキングは (1) アラート単体の重要度判定(severity ranking)と (2) アラートパターン(攻撃シナリオ・障害伝播パターン)の特定の 2 目的を含む。 ## 横断的知見 - **3 ルーツ系統対照**: [[@2009__ICAC__Ranking the Importance of Alerts for Problem Determination in Large Computer Systems|Jiang+ ICAC2009]] は不変条件(NTV: Normal Traffic Value)ピアレビューによる教師なしランキングで、アラートの「正常範囲からの逸脱」を統計的に評価する。[[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection|CAR(CIKM2018)]] は Pitman-Yor 階層ベイズ + エンティティ埋め込みの統一最適化で「個別アラート重要度」と「攻撃シナリオの完全性」を同時ランキングする教師なし手法。[[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems|AlertRank(ISSRE2020)]] は XGBoost incremental learning(Resolution Record を弱教師信号として使う)で教師ありランキングを実現する。「教師あり vs 教師なし」「最適化 vs 探索」「単一ドメイン vs 汎用」軸で対照的進化。(Source: [[@2009__ICAC__Ranking the Importance of Alerts for Problem Determination in Large Computer Systems]] §3–5, [[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection]] §3–4, [[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems]] §3) - **CAR は個別アラートとパターンを同時にランキング**: Pitman-Yor 前置木モデルで多段攻撃シナリオ(MLS/SNO/BOT/EEE/DAV/DCP)の復元精度 ROC-AUC 0.998 を達成し、後続の AlertRCA(2024)が「アラートだけで RCA」を実現する礎を築いた。個別アラートのランキング(entity-based ranking)と攻撃シナリオのランキング(scenario-based ranking)を同じ確率モデルで統一した点が方法論的に特徴的。(Source: [[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection]] §4) - **教師なし系の不利は「ソフトウェア変更への適応性」**: 教師なし(Jiang+/CAR)は invariant・パターン学習を**ある時点**で行うため、システム構成が変わると劣化する。AlertRank の incremental learning はこの適応性で勝る。逆に AlertRank はラベル(Resolution Record)の存在を前提とし、新規環境では cold-start という弱点を抱える。(Source: [[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems]] §4–5) - **TraceArk(ICSE-SEIP2023)が「アクショナビリティ」軸を導入**: 既存ランキングは severity 中心だが、[[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems|TraceArk]] は impact + interpretability の 2 軸で「実行可能なアラート」を定義する。マイクロサービスのトレースデータを活用して「どのサービスがどの程度影響を受けているか」を可視化し、Microsoft Exchange 本番 4 ヶ月で適合率 0.9068 を達成。これはランキングの目的関数を「severity」から「actionability」に拡張した転換で、[[アクショナブルアラート]] 概念との接続点となる。(Source: [[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems]] §3–5) - **教師あり ML 系統に「性能アラート×時系列エンリッチメント」という第4のバリアントが加わった**: [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features|Hmissa+ ICPE Companion2026]] は AlertRank(ISSRE2020、XGBoost incremental・Resolution Record 弱教師)と同じ「教師あり ML でランキング」系統に属するが、ラベルの性質と特徴量設計が異なる。AlertRank は Resolution Record という運用時に得られる弱教師信号でオンライン incremental 学習するのに対し、Hmissa+ は Bugzilla への紐付け(`bug_created`)という事後確定ラベルを CatBoost でバッチ学習し、短(pre=5,post=5)・中(pre=20,post=10)・長(pre=50,post=20)の3解像度で計算したデルタ・傾き・分位点統計等の時系列特徴量(40個)を構造化メタデータ(94+7個)に融合する。両者とも「severity ランキング」目的だが、AlertRank は適応性(incremental learning)を、Hmissa+ は時系列シグナルの多重解像度融合とリーク防止を強みとする、異なる設計軸の追求。(Source: [[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems]] §3–5, [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features]] §3) - **「リーク無しの厳密な時系列評価」を明示的方法論として確立した点が、既存3系統(Jiang+/CAR/AlertRank)に対する評価方法論上の新規性**: 既存の教師あり系統 AlertRank は incremental learning による適応性を主張するが、訓練/テスト分割の時間的厳密性(識別子・目的変数由来フィールドの除去、直近 k% を将来テストとして固定)を明文化した評価プロトコルは持たない。Hmissa+ は Bangash ら(2020, 欠陥予測の時間安定性研究)を根拠に、直近20%を保留テストとしハイパーパラメータ探索を訓練窓内に限定する評価規律を導入し、AUPRC 0.851・P@50 0.920 という数値を「将来の未見データでの性能」として提示する。これはアラートランキング全体にとって、時間的ドリフトへの脆弱性(既存の「教師なし系の不利」の知見と対をなす、教師あり系にも共通する評価上の落とし穴)を可視化する枠組みを提供する。(Source: [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features]] §2.2, §5) ## 未解決の問い - **AlertRank の incremental learning による適応性と、Hmissa+ の厳密な時系列ホールドアウト評価を組み合わせた設計は可能か**: 前者は「新しい運用パターンへの追従」、後者は「時間的ドリフトを考慮した誠実な性能推定」という異なる利点を持つが、両立を試みた研究はまだない。incremental に更新しながら常に「直近k%」で誠実に評価し続けるオンライン評価プロトコルが望まれる。 - Hmissa+ 自身が限界として認める「単一の時系列検証分割(blocked time-series cross-validation ではない)」は、AlertRank・CAR 等の既存ランキング手法の評価にも共通する潜在的弱点ではないか。アラートランキング研究全体で time-series-aware CV の標準化が必要かもしれない。 - 3 ルーツ系統(教師なし invariant、教師なし統一最適化、教師あり ML)を同一データセットで定量比較した研究は未着手。それぞれが「どの障害タイプ・どの規模のシステム」で優位かの系統的整理がない。 - 教師なし → 教師あり → アクショナビリティの直列パイプラインで本番運用された事例の文献的痕跡が皆無。AlertRank の incremental learning と TraceArk の impact 評価を組み合わせた適応型アクショナブルランキングは未提案。 - CAR の Pitman-Yor 前置木モデルはクラウド SRE のカスケード障害パターン(APT とは異なる)にも適用できるか? 攻撃シナリオ向けに設計されたパターン木が、障害伝播の「根本原因 → 影響拡大」という方向性の異なるパターンを捉えられるかは未検証。 ## 関連 - 親概念: [[アラート管理]] - 兄弟: [[アラート集約]]・[[アラートストーム]]・[[アクショナブルアラート]]・[[アラートインシデント分析]] - 関連手法: CAR(CIKM2018)・AlertRank(ISSRE2020)・TraceArk(ICSE-SEIP2023)・Hmissa+(ICPE Companion2026、時系列エンリッチメント CatBoost) - 一方向参照: [[structures/LLM4SRE - MOC]] ## 出典 - [[@2009__ICAC__Ranking the Importance of Alerts for Problem Determination in Large Computer Systems]] §3–5(不変条件 NTV ピアレビュー) - [[@2018__CIKM__Collaborative Alert Ranking for Anomaly Detection]] §3–4(Pitman-Yor 階層ベイズ・攻撃シナリオランキング) - [[@2020__ISSRE__AlertRank - Automatically and Adaptively Identifying Severe Alerts for Online Service Systems]](XGBoost incremental・Resolution Record 弱教師) - [[@2023__ICSE-SEIP__TraceArk - Towards Actionable Performance Anomaly Alerting for Online Service Systems]](impact + interpretability・actionability 軸) - [[@2026__ICPE Companion__Performance Alert Triage with Time-Aware Learning and Multi-Scale Time-Series Features]] §2.2, §3, §5(リーク無し時間認識型評価・マルチスケール時系列エンリッチメント)