# 運用文書駆動ベンチマーク生成
Navigation: [[LLM評価]] | [[AIOps]] | [[OpsQA]]
## 定義
運用文書駆動ベンチマーク生成(Documentation-Driven Ops Benchmark Generation)は、製品マニュアル・運用手順書などの Ops ドキュメントを入力として、OpsLLM(Operations Large Language Model)を評価するための質問-回答(QA)ペアを自動生成する手法群を指す。人手によるベンチマーク作成のコストと専門知識の必要性を、文書階層をたどる知識検索・タスク/アビリティ/モダリティ単位の制約付き生成・自動品質検証の組み合わせで代替する。[[OpsQA]](運用エンジニアが実際に発する質問に RAG で回答するタスク)とは異なり、こちらは**評価用データセットそのものを合成する**ことが目的である点で区別される。(Source: [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]])
## Eagle が確立した4段階パイプライン
Eagle([[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]])は本概念の一次提案・実証事例であり、次の4段階を確立した。
1. **Knowledge Extraction**: ドキュメント前処理 → [[DirDiver]](LLM ガイド型ディレクトリ階層走査、k=5 候補上限・D=6 深さ・S=64 ステップ)による知識検索 → データ型ラベル付け。
2. **QA Generation**: In-Breadth/In-Depth Evolving で生成した Seed Question(4,252件)とタスク別制約(55件)を知識コンテンツと統合し、統一プロンプトで質問・回答・鍵知識ポイントを同時生成。
3. **Quality Validation**: Critic Model による制約充足度スコアリング(質問品質)と、RAG(BGE-M3 埋め込み + FAISS 検索)ベース Answer Model による Correct/Wrong/Cannot Answer 判定(回答精度)の二重検証。
4. **Expert Annotation**: 産業界 Ops エンジニア(8名、3年以上の実務経験)による Specialty/Accuracy/Fluency/Answerability/Diversity の5次元ルーブリック採点。
## 横断的知見
- 単一ソース(Eagle)の提案段階のため、複数ソースを突き合わせた横断的知見はまだない。次の ingest で本節を育てる。
## 未解決の問い
- Eagle の "Not Self-Contained" ルール(回答に広い検索文脈やツールサポートを要する質問を保守的に棄却する設計)は、どの程度の割合で本来有用な評価項目を失わせているか。偽陰性率を定量化する評価軸は確立できるか。
- ドキュメント階層走査([[DirDiver]])に依存する知識検索は、階層構造の薄いドキュメント(単一の長大な PDF、Wiki 形式のフラットなページ群)にも同等の効果を持つか。
- Seed Question 生成(In-Breadth/In-Depth Evolving)は WizardLM・Self-Instruct の系譜だが、Ops ドメイン特有の制約設計(タスク/アビリティ/モダリティの3階層)は他ドメイン(セキュリティ運用、SRE 以外の DevOps 領域)にどこまで一般化できるか。
- ベンチマーク生成に用いる LLM(LLMgen)の頑健性(Eagle は Qwen2.5-72B・GPT-4.1・Gemini 2.5・Claude 3.7 Sonnet で合計スコア差 ±0.6 点)は、より小規模なモデルや専門特化モデルでも維持されるか。
- Huawei という単一企業環境での実証にとどまり、著者自身が組織横断的な妥当性検証を今後の課題としている。他組織のドキュメント文化(命名規則・構造化度合い)がパイプラインの精度にどう影響するか。
## 関連
- 親概念: [[LLM評価]] / [[AIOps]]
- 隣接概念: [[OpsQA]](評価データセット生成 vs. 実クエリへの回答という役割の違い)
- ソース: [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]]
- 実装システム: [[Eagle (OpsLLMベンチマーク)]] / [[DirDiver]] / [[Bonito]] / [[Forge (5G Instruct Forge)]]
## 出典
- [[@2026__FSE Companion__Eagle - Leveraging Operations Documents for Comprehensive Benchmark Question Generation]]