# MLモデル監視 ## 定義 ML モデル監視は、本番環境で稼働する機械学習モデルの品質・挙動・入出力データを継続的に計測し、劣化やサイレント障害を検知する取り組みを指す。従来のバックエンド監視(レイテンシ・トラフィック・エラー・飽和度の 4 ゴールデンシグナル)はサービスの稼働状態を捉えるが、ML 固有の障害——入力データの単位変更、特徴量ドリフト、劣化モデルの自動リリース、後処理フィルタの破損——はエラーやレイテンシに現れず、サイレントに品質を損なう。Google の ML Test Score 論文はこの追加的複雑さ(データテスト・スキューテスト・データ監視・予測監視)を体系化している。(Source: [[@2023__SREcon23 EMEA__Symptom-based Alerting for Machine Learning]]) [[Lina Weichbrodt]] は SREcon23 EMEA で、SRE の症状ベースアラーティング——原因でなくエンドユーザーの痛みに着目する——を ML リクエストシーケンスに適用し、出力側から逆順に監視を優先する 3 段階フレームワークを提示した: 1. **Priority 1 — ユーザー影響**: 本番での評価メトリクス(正解ラベルが得られる場合の適合率・再現率等)およびステークホルダー懸念シグナル(最悪シナリオの恐怖をメトリクス化)。 2. **Priority 2 — サービス応答分布**: 後処理後の出力分布を監視。ルールベース距離(中央値・分位点・空応答割合)、統計的距離(KS 統計量・D1 距離・PSI)、ヒューリスティック品質指標(パーソナライズ応答割合等)。 3. **Priority 3 — 入力/特徴量データ分布**: Priority 2 と同じ距離メトリクスを入力側に適用。出力アラートの根本原因分析に有用。例外として訓練-サービング間スキュー監視は Priority 1。 ## 横断的知見 - **Weichbrodt の症状ベースアラーティング(SREcon23 EMEA)と TrainCheck(SREcon26 Americas)は、監視の「活動」対「正当性」という同じ軸で対比できる**。Weichbrodt はユーザーへの影響(出力分布の変化など症状)から逆順に監視を設計するのに対し、TrainCheck は訓練プロセス内部の API 行動・変数状態という正当性シグナルを直接計測する。前者は本番推論の劣化を症状から検知し、後者は訓練中のサイレント障害を根本原因レベルで即時検知する——監視対象フェーズ(推論 vs 訓練)と観測レイヤー(出力分布 vs 内部正当性)の両方で異なるアプローチである。(Source: [[@2023__SREcon23 EMEA__Symptom-based Alerting for Machine Learning]], [[@2026__SREcon26Americas__Beyond Loss and Accuracy - Closing the Observability Gaps in AI Training with TrainCheck]]) - **両ソースを通じて「遅すぎる検知」が共通の課題として浮かぶ**。Weichbrodt は「問題に気づいたときにはすでに数時間分のユーザー体験が損なわれている」と述べ、TrainCheck は「問題に気づいたときには数千ステップ前にロールバックしなければならない」と示す。監視の遅延コストは推論フェーズでも訓練フェーズでも甚大であり、より上流での検知が共通の解法方向である。(Source: [[@2023__SREcon23 EMEA__Symptom-based Alerting for Machine Learning]], [[@2026__SREcon26Americas__Beyond Loss and Accuracy - Closing the Observability Gaps in AI Training with TrainCheck]]) ## 未解決の問い - Weichbrodt の 3 段階優先順位は 30 ユースケースの経験則に基づくが、ドメインによる優先順位の逆転(例: 金融の規制要件で入力監視が最優先になるケース)はどの程度あるか。 - ML の出力分布監視と[[異常検知]]の時系列異常検知手法(Chandola 2009 等)の接続: 出力スコア分布の変化点検知に時系列異常検知を適用した産業事例はあるか。 - 「評価メトリクスと検知メトリクスは異なる」という Weichbrodt の区別は、SRE における SLI/SLO と監視メトリクスの区別とどこまで対応するか。 - LLM のテキスト出力に対する分布監視手法はスコア分布と同じアプローチで機能するか。Weichbrodt はリスト(p.25)で LLM を挙げるが具体的手法は示していない。 ## 関連 - [[アラート管理]] — ML 監視は既存のアラート管理フレームワークの上に構築される。 - [[アクショナブルアラート]] — ML のサイレント障害を検知するアラートはアクショナブル性の新しい次元を必要とする。 - [[異常検知]] — 出力/入力分布の変化検知は異常検知の応用。 - [[オブザーバビリティ]] — ML 監視はオブザーバビリティの ML ドメインへの拡張。 ## 関連 - [[DLトレーニングサイレントエラー]] — 訓練フェーズのサイレント障害に特化した上位概念 - [[訓練不変条件]] — TrainCheck による訓練正当性シグナルの実装 ## 出典 - [[@2023__SREcon23 EMEA__Symptom-based Alerting for Machine Learning]] - [[@2026__SREcon26Americas__Beyond Loss and Accuracy - Closing the Observability Gaps in AI Training with TrainCheck]]