# 知識蒸留
## 定義
知識蒸留(Knowledge Distillation)は、大規模言語モデル(LLM、教師モデル)が持つ推論・言語理解能力を、より軽量な小規模言語モデル(SLM、学生モデル)に転移する技術である。AIOps 文脈では、単純なラベルだけでなく Chain-of-Thought(CoT)推論根拠を教師 LLM に生成させ、それを学生 SLM の教師あり微調整(SFT)に用いることで、少量のラベル付きデータのみで専門家水準の判断能力を SLM に獲得させる手法として応用される。CoTriage([[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]])は、ラベル付きチケット集合 T の各サンプル (t_i, k_i, y_i)(チケット内容・ドメイン知識・正解ラベル)を CoT プロンプトで教師 LLM(GPT-3.5-Turbo-16k)に入力し、推論根拠 r_i を生成させて蒸留データセット D = {(t_i, k_i, r_i, y_i)} を構築、これで学生 SLM(Triager)を SFT する。(Source: [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]] §4.2.1)
知識蒸留単体では初期性能に留まるため、実用システムでは以下の 2 つの後段最適化と組み合わせることが多い。
1. **自己強化(self-reinforcement)**: 蒸留済みモデル自身が新規サンプルを生成・予測・自己評価し、その評価結果(報酬スコア)から選好ペアを構成して DPO(Direct Preference Optimization)で反復的に自己改善する。教師モデルへの追加問い合わせなしに継続的な性能向上が可能。
2. **報酬モデルとしての転用**: 蒸留・自己強化を経た判定モデルを、別タスク(要約生成など)の DPO 報酬モデルとして再利用し、下流タスクの出力をターゲットタスクの性能に整合させる end-to-end 最適化を行う。
## 横断的知見
- **知識蒸留の適用対象は「LLM→SLM のテキスト判定タスク」だけでなく「大型時系列モデル→軽量時系列モデルの数値再構成タスク」にも及ぶ**: CoTriage([[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]])は CoT 推論根拠を用いた分類判定の蒸留だったのに対し、RefinedEdge([[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]])は再構成ベースの多変量時系列異常検知モデル(TimesNet)を教師とし、再構成損失(自己学習)と蒸留損失(教師出力との差)を係数 λkd で線形結合した目的関数(Ltotal=λkd·Lrecon+(1-λkd)·Lkd)で 0.12M パラメータの学生モデルへ蒸留する。両者に共通するのは「単純な教師模倣だけでは不十分で、自己学習成分とのバランスが精度を左右する」という設計原理であり、CoTriage の自己強化(self-reinforcement)と RefinedEdge の再構成損失は、ドメインは異なるが同じ「蒸留 + 自己学習のハイブリッド」という構造を持つ。(Source: [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]], [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]])
- **蒸留バランス係数のスイートスポットはベル型カーブとして現れる**: RefinedEdge は係数 λKD を 0〜1.0 で振った実験で、λKD=0.6 付近をピークとするベル型の性能曲線を報告した(両極端——教師模倣過多・自己学習過多——のいずれでも性能が劣化)。CoTriage の自己強化+DPO も「蒸留のみでは初期性能に留まる」ことを前提に後段最適化を積み増す設計であり、蒸留単体で最適化が完結しないという経験則が、テキスト判定・時系列再構成という異なるモダリティで独立に観測されている。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] §V-C)
- **RefinedEdge は蒸留後も継続的な双方向更新(Reciprocal Edge-Cloud Updating)を組み込む**点で、CoTriage の「一度蒸留すれば完結」に近い設計と対照的である。エッジ側の個人化モデルが Reverse Knowledge Distillation でクラウド教師モデルの更新を導き、更新後の教師が学生モデルの再蒸留を導く周期的サイクル(24 時間)を持つ。この「継続蒸留」の効果は、評価対象データセットに概念ドリフトがあるかどうかに強く依存する(ドリフトが乏しい EdgeNode では更新の有無で差が出ない一方、ドリフトのある SMD/SMAP では有意な改善)。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] §V-D)
## 未解決の問い
- CoTriage の自己強化メカニズムは「モデル自身の内的認知に依存する」ため、ベースモデルが訓練時に吸収したバイアスを増幅しうると著者ら自身が限界として指摘する(§7.1.1)。この自己強化誘発バイアスは、他の self-rewarding / RLAIF 系手法(Self-Rewarding Language Models 等)でも共通して観測される問題か、それとも AIOps 固有の症状(ドメイン知識の偏りが顕著)か。
- 報酬モデルとして転用された Triager(トリアージ精度で要約品質を評価)は、Summarizer の出力を「トリアージに有利な情報」へ最適化するが、これは「人間にとって読みやすい要約」との間にトレードオフを生みうるか。CoTriage の人手評価(Table 6)は Relevance・Informativeness の向上を示すが Readability は評価されていない。
- 知識蒸留 + 自己強化 + DPO 報酬モデリングという 3 段階構成は、チケットトリアージ以外の分類集約タスク(バグトリアージ・ログ分類・アラート分類等)にどこまで汎用的に転用できるか。CoTriage は MSR 2013 Bug データセットで汎化性を検証したが(§5.9)、性能はチケットトリアージより有意に低い(ACC@1=0.335)。
- 同一著者陣・同一ドメイン(ByteDance STE チーム)で、OncallX([[オンコール自動化]])は fine-tuning-free な知識グラフ拡張アプローチ、CoTriage は知識蒸留 + RL によるファインチューニングアプローチという対照的な設計を採る。両者を統合(KG によるカテゴリ空間の事前絞り込み + 蒸留済み SLM による最終判定)した場合、単独手法を上回るか。
- RefinedEdge が示した「蒸留バランス係数のベル型スイートスポット」は、CoTriage のような LLM→SLM テキスト分類蒸留にも同型で現れるか。CoTriage は自己強化の反復回数やバイアス増幅を課題として挙げるが、蒸留と自己学習の配分比率を明示的に振った感度分析は行っていない。両ドメインの蒸留設計を統一的なハイパーパラメータ探索の枠組みで比較できるか。(Source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] §V-C, [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]])
- RefinedEdge の Reciprocal Edge-Cloud Updating(継続蒸留)は概念ドリフトが無いデータセットでは効果が観測されないと報告された。CoTriage の自己強化もモデル自身の内的認知に依存してバイアスを増幅しうると自己申告している。「継続的な自己/相互更新をいつ止めるべきか(ドリフト検知に基づく更新トリガー)」は両ドメイン共通の未解決課題ではないか。
## 関連
- 関連 source: [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]] / [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]]
- 関連 concept: [[オンコール自動化]] / [[インシデントトリアージ]] / [[LLMによる根本原因分析]] / [[モデル圧縮]] / [[異常検知]] / [[Edge-cloud Collaboration]]
- エンティティ: [[Ruowei Fu]] / [[Shenglin Zhang]] / [[Yongqian Sun]] / [[Nankai University]] / [[ByteDance]] / [[RefinedEdge]] / [[Dan Pei]] / [[Minghua Ma]]
## 出典
- [[@2026__nkcs.iops.ai__Collaborative Knowledge Distillation and Reinforcement Learning for Automated Ticket Triage in Large-Scale Production Systems]](§4.2 知識蒸留・自己強化、§4.3 報酬モデルとしての転用、§7.1.1 限界)
- [[@2025__TSC__Bridging Edge and Cloud - A Knowledge-Enhanced Framework for Efficient Time Series Anomaly Detection]](§IV-C Knowledge Refinement Process、§V-C RQ2 ハイパーパラメータ感度、§V-D RQ3 更新戦略比較)