# インシデントトリアージ
## 定義
インシデントトリアージ(Incident Triage)は、発生したインシデントを解決の責任を持つ適切なチームへ割り当てるプロセスである。[[インシデント管理]]のライフサイクル(検知→トリアージ→緩和)において、検知直後・緩和着手前に位置する工程であり、トリアージ完了までの時間は Time to Triage(TTT)、検知から緩和完了までは Time to Mitigation(TTM)と定義される([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]] Fig. 1)。伝統的にはルールベースの決定木(例: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]] の AutoAnalysis)で実装されるが、新規シナリオへの継続的なルール更新が必要という限界があり、分類器ベース([[DeepCT]]・[[DeepTriage]] 等)や LLM ベース([[COMET]])の手法が提案されてきた。
## 横断的知見
- (このページは本ソースの取り込みで新規作成した。現時点では単一ソース([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]])のみに基づくため横断的知見は蓄積されていない。今後、他のトリアージ関連ソース([[DeepCT]]・[[DeepTriage]] 等の原論文が ingest された際、または関連する [[インシデント優先順位付け]]・[[インシデントTTM予測]] との突き合わせで得られた観察をここに追記する。)
- **同じベースライン群(DeepCT・DeepTriage・COMET)が、Microsoft 系(本概念)と ByteDance/Nankai 系([[オンコール自動化]]・[[知識蒸留]])という異なる研究系譜のトリアージ論文で共通の比較対象として使われている**: CoTriage([[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]])は ByteDance STE チームのチケットトリアージで DeepCT・DeepTriage・COMET を非 LLM/LLM ベースラインとして採用し、ACC@1 で +28.2〜40.4pt(非 LLM 比)の改善を報告する。InsightTriage([[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]])も Huawei ICV データで DeepTriage・COMET を含む 4 手法をベースラインとして採用しており(Weighted F1: DeepTriage 0.500・COMET 0.211 vs. InsightTriage 0.801)、DeepCT・DeepTriage・COMET が組織・ドメイン(ByteDance のオンコール、Huawei の車載)を越えて事実上の標準ベースライン群として定着していることを示唆する。ただし各論文のデータセット規模・分割方法は異なるため、性能数値そのものは直接比較できない。(Source: [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]] §5.4、[[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] Table 2)
- **COMET が複数の異なるドメインで一貫して低性能を示す一方、その原因の説明は各論文で異なる**: 本概念の定義元 COMET 論文([[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]])自身はキーワード抽出+埋め込み類似度によるオンライン展開で ACC@1 を 30% 改善したと報告するが、InsightTriage([[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]])が Huawei ICV データで再実装した COMET は Weighted F1 = 0.211 と全ベースライン中最低の性能に留まった。InsightTriage の著者は、COMET のルールベースキーワードフィルタリング(例: "crash")が症状駆動で多様な ICV シナリオに不適合であることを原因として挙げる。**同一手法の移植性の低さが、トリアージ手法の一般化可能性という共通課題を浮き彫りにする**。(Source: [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] §5.2)
- **「ログをどう使うか」がチケットトリアージ手法を差別化する軸として浮上している**: COMET はキーワードベースの単純なログ選択、InsightTriage はコントラスティブ学習によるクエリ駆動ログ検索+LLM 構築の構造化知識ベースという、ログ活用の深さが大きく異なる 2 つの設計を代表する。InsightTriage のアブレーション(ログ検索器除去で Weighted F1 が 0.801→0.609、19.2% 低下)は、ログを「単なる補助情報」から「クエリと同格の一次証拠」として扱うことの効果を定量的に裏付ける。(Source: [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]] §5.3.2)
## 未解決の問い
- インシデントトリアージ(チーム割り当て)と[[インシデント優先順位付け]](緩和の優先順位付け)は、Microsoft の異なる研究系譜(本ソースの著者群 vs [[インシデントTTM予測]]の Chen+チーム)がそれぞれ攻めているが、両者を統合したパイプライン設計(トリアージ→優先順位付け→緩和の一気通貫最適化)はどう設計すべきか。
- LLM ベースのトリアージ([[COMET]])における「キーワード抽出が要約より優れる」という知見は、根本原因分析(RCA)や TTM 予測など他のインシデント管理タスクにも一般化できるか。
- COMET の語彙制限(訓練時抽出キーワードのみを推論時に許容)は新規キーワードの取りこぼしリスクを伴う。オープン語彙かつオンライン処理可能なキーワード抽出手法は実現できるか。
- 2023年以降のLLMベース RCA 手法(RCACopilot・RCAgent・[[@2024__ICSE__Xpert - Empowering Incident Management with Query Recommendations via Large Language Models|Xpert]] 等)とのトリアージ精度の直接比較は行われていない。同一データセット・同一評価指標での横断比較はどう設計すべきか。
- COMET が Microsoft クラウドサービス(元論文)と Huawei ICV(InsightTriage の再実装)で性能が大きく乖離した(30% 改善 vs. 最低性能)原因は、ドメインの違いか、再実装の忠実度か、それとも「ルールベースキーワードフィルタリング」という設計自体の一般化限界か。追試による切り分けが必要。
- ログをクエリ駆動で検索する設計(InsightTriage のコントラスティブ学習ログ検索器)は、車載ログ以外のドメイン(クラウドサービス・マイクロサービス)のチケットトリアージにも同程度の効果(19.2% の性能寄与)をもたらすか。
## 関連
- ソース: [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]] / [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]](同一ベースライン群を用いる別系譜) / [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]](COMET を再実装しログ活用を深化させた ICV ドメイン版)
- 概念: [[インシデント管理]](上位概念・ライフサイクル全体) / [[インシデントTTM予測]](トリアージ後の緩和時間予測) / [[インシデント優先順位付け]](並列研究系譜) / [[オンコール自動化]](チケットトリアージをサブタスクとする ByteDance/Nankai 系譜) / [[知識蒸留]](CoTriage の中核技術)
- エンティティ: [[Zexin Wang]] / [[Minghua Ma]] / [[Chetan Bansal]] / [[Microsoft]] / [[Ruowei Fu]] / [[Shenglin Zhang]] / [[Nankai University]] / [[Huawei Technologies]]
## 出典
- [[@2024__ISSRE__Large Language Models Can Provide Accurate and Interpretable Incident Triage]](§II 実証研究・§III COMET アーキテクチャ・§V オフライン評価・§IV オンライン展開)
- [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]](§5.4 ベースライン比較で DeepCT・DeepTriage・COMET を共通比較対象として使用)
- [[@2026__ASE__LLM-Assisted Joint Ticket and Log Analysis for Incident Triage in Intelligent and Connected Vehicles]](§3・§5.1.4・§5.2 でベースライン比較・COMET 再実装結果を報告)