# RAGノイズ除去 ## 定義 RAGノイズ除去は、検索拡張生成(RAG)で LLM に渡す検索結果から、推論に役立たない、または推論を誤らせる情報を、インデックス作成・検索・文脈組み立て・検証・閉ループ訓練の各段で抑える設計である。Dai らはノイズを、トークン・レイテンシ・注意予算を消費するだけでなく、モデルを誤誘導する取得内容として定義し、LLM 向け IR の主要ボトルネックは raw recall ではなく利用可能な証拠密度であると主張する。(Source: [[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]]) ## 横断的知見 - **「多く取得するほどよい」は、運用系 RAG でもコーディングエージェントでも崩れている**: Dai らの NQ 実験では金パッセージが存在してもノイズ 9 件が加わると EM が 22.2〜26.6% まで落ちる。[[OpenRCA]] や [[LogPilot]]、[[LLM4Log - A Systematic Review of Large Language Model-based Log Analysis|LLM4Log]] が示すように、運用診断でも raw テレメトリやログをそのまま LLM に渡すのではなく、候補窓・代表リクエスト・知識断片を先に絞る設計が成功パターンになっている。RAGノイズ除去は、検索 QA だけでなく AIOps/RCA の入力選別と同型の問題である。(Source: [[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]], [[LLM4Log]], [[RCA入力選別]]) - **ノイズ除去は安全性境界でもある**: Dai らは間接プロンプトインジェクションと検索汚染を文脈構成ノイズの一部として扱う。[[エージェント運用安全性]] は、運用成果物を authoritative / advisory / untrusted に分け、untrusted 入力で書き込みを駆動しない規律を要求する。RAGノイズ除去は品質改善だけでなく、検索チャネルを攻撃面として扱う安全設計でもある。(Source: [[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]], [[エージェント運用安全性]]) - **RCAドメインのRAGノイズは「無関係文書」でなく「重複ケース」と「相関を因果と誤認するグラフ構造」という2種の固有形態を取り、AIDAはこれをインデックス構築段(検索時でなく)で除去する**: Dai らの denoising-first パースペクティブはノイズを検索・文脈組み立て・検証・訓練の各段で扱う一般的な分類を示すが、[[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]] はRCAという具体ドメインで、ノイズの正体を2種に特定する。(1) データ冗長性ノイズ: 少数の一般的な根本原因(光モジュール故障等)が大量の類似ケースを生み、ナイーブRAGの検索結果を支配してレアな故障タイプを覆い隠す(hit rate低下、Figure 4)。(2) 構造的ノイズ: GraphRAG等の汎用知識グラフ構築は統計的相関を因果関係と誤認し、ノイズの多い非因果リンクを大量に生成する(Figure 5)。AIDAはこの2種のノイズを検索時のフィルタリングではなく、SimRankベースのノード統合という**インデックス構築段**で解消する——RLでファインチューニングしたLLMが因果的に整合した推論チェーンだけを抽出し、構造考慮の統合で冗長ノードを62.7%削減してからKGに格納する。「ノイズを検索前に除去しておく」設計は、Dai らの分類における「インデックス作成」段の具体的な実装パターンを、RCAドメインで実証した事例として位置づけられる。(Source: [[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]], [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]] §2.4, §3.3.2) ## 未解決の問い - 文脈圧縮・再ランキング・矛盾解決・引用検証を組み合わせたとき、どの段が最も効くかを分解評価する標準実験はまだ不足している。 - 検索結果の「ノイズ」はタスク依存である。QA では無関係な文書がノイズでも、ディープリサーチでは反対意見や古い情報が必要な証拠になる場合がある。タスクごとのノイズ定義をどう型付けするか。 - セキュリティ目的の強いフィルタは、探索的リサーチに必要な多様性を削る可能性がある。来歴・信頼度・多様性・新規性を同時に最適化する実装が必要である。 - **AIDAのインデックス構築段でのノイズ除去(SimRankノード統合)と、Dai らが扱う検索時・文脈組み立て時のノイズ除去は、どちらがコスト効率で優れるか未比較**: AIDAはノイズ除去のコストをオフラインのKG構築(バッチ100件で平均5.86分)に前倒しする設計だが、これはオンライン検索時にリアルタイムでフィルタリングする設計(Dai らの想定に近い)と比べて、更新頻度が低いドメイン(ネットワーク機器の故障パターン)でのみ有利という制約がある可能性がある。動的に変化する知識ドメインでは、インデックス時ノイズ除去は陳腐化しないか。 ## 関連 - [[LLM向け情報検索]] - [[RCA入力選別]] - [[エージェント運用安全性]] - [[LLMアプリケーション信頼性]] - [[グラフベースRCA]](AIDAのSimRankベースKG構築を扱う姉妹concept) ## 出典 - [[@2026__SIGIR__LLM-Oriented Information Retrieval - A Denoising-First Perspective]] - [[@2026__SIGCOMM__AIDA - Accelerating Root Cause Analysis for Multi-Vendor Device Failures with LLM-Powered Reasoning]](§2.4 Key Observations 1-2、§3.3.2 KG構築)