# Natural Language Query to Configuration for Retrieval Agents > [!abstract] 概要 > 現代の検索エージェントは、LLM、検索器、文書数、ホップ数、統合戦略など多岐にわたる構成の選択肢を露出しており、その各々が回答品質と提供コストの双方を左右する。現在、これらのパイプラインは通常ワークロードごとに一度手動で調整されるにとどまり、クエリ単位での大幅な最適化余地が未活用のまま残されている。我々は Query2Conf を定式化する。すなわち、自然言語クエリと精度目標または予算目標のいずれかが与えられたとき、推論時に事前定義されたパイプラインカタログからコストを最小化(または精度を最大化)する構成を選択する問題である。我々は、LLM を用いて各クエリをワークロード特化型の特性へと変換し、そのパイプラインがクエリに正しく回答するかを推定する構成ごとの軽量予測器を訓練する BRANE を提案する。推論時において BRANE は、コストでペナルティを課した予測正解率を最大化する構成を選択し、再訓練を行うことなく調整可能なコスト・品質のトレードオフを提供する。MuSiQue、BrowseComp-Plus、および FinanceBench 全体にわたり、BRANE は一貫してコスト・品質のパレートフロンティアを押し広げ、最良の固定構成の精度を最大 89% 低いコストで達成し、LLM ルーティング、ルールベース、およびファインチューニング済み Qwen3-4B のベースラインを凌駕する。これらの結果は、完全な検索パイプラインのクエリ単位構成が、ワークロードレベルの静的調整に対する実用的な代替手段であることを示している。 ## 論文情報 - **タイトル**: Natural Language Query to Configuration for Retrieval Agents - **著者**: Melissa Z. Pan (UC Berkeley), Negar Arabzadeh (UC Berkeley), Mathew Jacob (UW), Fiodar Kazhamiaka (Microsoft Azure Research - Systems), Esha Choukse (Microsoft Azure Research - Systems), Matei Zaharia (UC Berkeley) - **媒体**: arXiv preprint (cs.AI), arXiv:2605.27361 - **発表日**: 2026-05-26 - **プロジェクト**: BRANE (Building Retrieval Agents via Natural language Expressions) ## 概要 現代の複合AIシステムや検索エージェント(Perplexity、ChatGPT Search、Gemini Deep Research等)は、単一のLLM呼び出しにとどまらず、検索器の種別、取得深度 $k$、文書要約や反復ループを含む統合戦略など複雑な構成空間を持つ。従来はこれらをワークロードごとに一度手動調整した静的構成(固定パイプライン)で運用していたが、クエリごとの難易度や要求構造のばらつきにより、膨大なコスト浪費や精度不足が生じていた。本研究は、自然言語クエリから推論時にコスト・精度のトレードオフを動的に最適化する問題「Query2Conf」を定式化し、これを解決するフレームワーク「BRANE」を提案する。BRANE はオフラインでフロンティアLLMが発見したワークロード特化型の二値特性によりクエリを特徴ベクトル化し、構成ごとの軽量分類器で正解確率を予測してラグランジュ緩和に基づき最適構成を選択する。 ## 問題設定 ### 観測事実に基づく動機付け 1. **クエリ単位の分散(Query-Level Variance Within a Workload)**: 単一コーパス上の同一ワークロードであっても、事実確認、マルチホップ比較、曖昧性解消などクエリの構造は多岐にわたる。Figure 3a に示す通り、同一クエリでも統合戦略ごとに正解率とコストが桁違いに変動し、単一の固定構成では全クエリを最適に処理できない。 2. **LLM 単体ではなくパイプライン全体の構成が支配的(Configuring the Full Pipeline Matters)**: Figure 3b に示すように、LLM モデル自体の変更(GPT-5 nano → mini → 5.4)によるコスト・精度スパンよりも、検索器・取得深度 $k$・統合戦略を変更した際のスパンの方が約10倍広く、LLM ルーティングのみでは最適化余地を大幅に見落とす。また文書数 $k$ の増加はコストを単調増加させるが、無関係文書の混入により精度は非単調に低下しうる。 3. **有効なクエリ特性はワークロードごとに異なる(Workload-Specific Signal)**: 先行研究(METIS等)の静的ルールが用いる汎用属性(推論の要否など)は同一ワークロード内の全クエリで同一値に縮退し(Figure 3c)、識別能力を失う。ワークロード固有の細粒度シグナルが必要である。 **Figure 3: 知識検索パイプラインから得られた3つの観測事実** ![[_attachments/arxiv-2605.27361/fig03-observations.png]] (Figure 3. (a) BrowseComp-Plus におけるクエリ単位の分散: 3クエリ×3統合戦略。最適戦略はクエリごとに異なる。(b) FinanceBench におけるノブ比較: パイプライン構成探索(橙)はLLMスケーリング(青)より約10倍広いコスト範囲と約2倍の精度幅をカバー。(c) 汎用クエリ特性の限界: BrowseComp-Plus の全クエリが同一値に縮退し同一構成にマッピングされてしまう。) ### Query2Conf の数学的定式化 固定コーパス上のクエリ分布をワークロード $W$、候補パイプライン構成の有限集合を $C$ とする。クエリ $q \sim W$ に対し構成 $c \in C$ を実行した際の正解判定を $y_c(q) \in \{0, 1\}$、ドルコストを $\text{cost}(q, c) \ge 0$ とする。目標精度 $A \in [0, 1]$ が与えられたとき、期待コストを最小化するポリシー $\pi: W \to C$ を学習する: $ \min_\pi \mathbb{E}_{q \sim W} [\text{cost}(q, \pi(q))] \quad \text{subject to} \quad \mathbb{E}_{q \sim W} [y_{\pi(q)}(q)] \ge A $ (予算制約 $B$ 下での精度最大化問題も同様に定式化される。) ## 提案手法 BRANE は構成間の組合せ爆発を直接数理モデル化するのではなく、プロファイルされた実行結果に基づき「構成ごとの正解確率」を独立に予測する分解アプローチを採る。 **Figure 2: BRANE フレームワークの全体像** ![[_attachments/arxiv-2605.27361/fig02-brane-framework.png]] (Figure 2. (1) 構成プロファイリング: ワークロード上で $N$ クエリ×全構成を実行し正解成否とコストを記録。(2) 予測器の訓練: フロンティアLLMが少数のクエリからワークロード特化の二値特性集合を提案し、安価なLLMが全プロファイルクエリを特徴化。パレート構成ごとに軽量予測器を訓練。(3) 推論時: ユーザの精度/予算目標に応じた $\lambda$ に基づき、クエリ特性から各構成のスコアを算出して最適構成 $c^*$ を選択・実行。) ### 1. ワークロード特化型クエリ特性化(Query Characterization) - **特性生成**: オフラインで少数のサンプルクエリ(数十件)をフロンティアLLM(GPT-5-mini)に提示し、クエリテキストのみから Yes/No で判定可能な $d$ 個の二値質問 $\{F_j\}_{j=1}^d$(例: `requires_multihop`, `involves_regional_cuisine` 等、$d \approx 10$)を自動提案させる。 - **特徴ベクトル化**: 安価なLLMを用いて全クエリを評価し、二値特徴ベクトル $\mathcal{F}(q) = [F_1(q), \dots, F_d(q)] \in \{0, 1\}^d$ を得る。一定値の成分や相関係数 0.99 以上の冗長成分は事前に除外する。 - **意味空間との架橋**: 単一ドメイン(例: 財務文書)では埋め込みベクトルが狭い空間に密集し構成選択に必要なシグナルが失われるのに対し、二値特性はタスク要求に直結する述語を直接抽出する。 ### 2. ファジーパレート刈り込み(Fuzzy Pareto Pruning) 全構成 $|C|$ に対する分類器訓練と推論コストを削減するため、プロファイリング結果のコスト・精度パレートフロンティア近傍の構成のみを保持する。サンプリングノイズによる有望構成の脱落を防ぐため、真のパレート頂点 $c^\star$ に対し以下を満たす候補 $c'$ を保持する: $ \bar{y}(c^\star) - \bar{y}(c') \le \tau_{\text{acc}} \quad \text{かつ} \quad \overline{\text{cost}}(c') \le (1 + \tau_{\text{cost}}) \overline{\text{cost}}(c^\star) $ ### 3. 構成別軽量予測器(Per-Configuration Predictor) 生存したパレート構成 $c \in C_{\text{Pareto}}$ ごとに、入力 $\mathcal{F}(q)$ から正解確率 $\hat{p}_c(\mathcal{F}(q)) \approx P(y_c(q) = 1 \mid \mathcal{F}(q))$ を出力する軽量な表形式分類器(XGBoost、LightGBM、ロジスティック回帰、ランダムフォレスト等)を訓練する。内部3分割交差検証の対数損失(log-loss)により最適モデルを自動選択する。 ### 4. ラグランジュルーティング(Lagrangian Routing) 推論時、トレードオフパラメータ $\lambda \ge 0$ を用いて以下のスコアを最大化する構成を選択する: $ \pi_\lambda(q) = \arg\max_{c \in C_{\text{Pareto}}} \left( \hat{p}_c(\mathcal{F}(q)) - \lambda \cdot \overline{\text{cost}}(c) \right) $ $\lambda$ を対数スケールで走査することで再訓練なしに任意のコスト・精度パレートフロンティア上の動作点を再現できる。目標精度 $A$(または予算 $B$)への $\lambda$ のキャリブレーションはオフラインプロファイルデータ上で行う。 ## 新規性 1. **LLM単体ルーティングからフルパイプライン構成への拡張**: FrugalGPT、Carrot、RouteLLM 等の従来研究がLLMモデル選択のみを対象としていたのに対し、検索器、取得件数 $k$、合成戦略(LLM単体、直接連結、チャンク要約、エージェントループ)を含む複合パイプライン全体を動的選択の対象とした。 2. **ワークロード特化型二値特性の導入**: 一般的な埋め込み表現や、METIS のような固定手動ルールによる属性分類に代わり、フロンティアLLMがワークロード固有に提案する述語集合を用いることで、高いデータ効率と説明可能性を実現した。 3. **プロファイル正解率に基づく組合せ相互作用の内包**: ノブ間の複雑かつ非単調な相互作用を明示的な数理シミュレーションで解くのではなく、構成ごとの正解成否ラベルに吸収させ、独立な軽量分類器群に分解した。 ## 実験設定 - **ベンチマーク**: - **MuSiQue** [28]: マルチホップ推論質問応答(600クエリ、131構成) - **BrowseComp-Plus** [7]: ディープリサーチエージェント評価(600クエリ、60構成) - **FinanceBench** [10]: 企業開示書類に基づく金融QA(150クエリ、335構成) - **構成探索空間**: - **統合戦略**: LLM-only、RAG(直接連結)、RAG(チャンク単位要約)、Agent Loop(検索拡張型反復ループ) - **LLM**: GPT-5-mini、GPT-5-nano、GPT-5.4、Gemini-3.1-pro/flash-lite、Llama-3.1-8B/70B、Qwen3.5-122B/27B/flash - **検索器**: BM25、E5、GTE、Qwen3-8B Dense、ハイブリッド検索 - **取得深度 $k$**: 1〜100 - **評価方法**: 5分割外部交差検証。GPT-5-mini を LLM 判定器(Judge)として正解率を測定。BRANE のコストにはクエリ特性抽出の LLM 呼び出しコスト(最良精度の生成コストの平均 4.4%)を合算。 - **ベースライン**: 最良静的構成(Murakkab)、METIS(拡張版)、Adaptive-RAG(拡張版)、CARROT(KNN / RoBERTa、LLM単体版および拡張版)、エンドツーエンドファインチューニング(BERT、Qwen3-4B with LoRA)。 ## 実験結果 **Figure 1: BrowseComp-Plus におけるコスト・品質設計空間とパレートフロンティア** ![[_attachments/arxiv-2605.27361/fig01-cost-quality-design-space.png]] (Figure 1. 60通りの構成プロファイル結果。BRANE は最高精度の静的構成(紫四角)の精度を0.7%上回りつつコストを81.7%削減し、静的パレート境界を完全に支配する。) **Figure 4: 3大ベンチマークにおける 100% 精度目標パレートフロンティア** ![[_attachments/arxiv-2605.27361/fig04-pareto-frontiers.png]] (Figure 4. MuSiQue で 89.4%、BrowseComp-Plus で 81.7%、FinanceBench で 8.1% のコスト削減を達成し、既存ベースラインを全域で支配。) ### 静的最高精度に一致させた場合のコスト削減率(Table 1) 以下の表は、各ベンチマークにおいて最良静的構成(Murakkab)の精度、その 95%、および 90% の精度目標を達成した際の静的構成比コスト削減率(%)を示す。 | 手法 | 100% 精度目標 (MuSiQue / BrowseComp+ / FinanceBench) | 95% 精度目標 (MuSiQue / BrowseComp+ / FinanceBench) | 90% 精度目標 (MuSiQue / BrowseComp+ / FinanceBench) | |---|---|---|---| | **最良静的構成 (Murakkab)** | 0.0% / 0.0% / 0.0% | 0.0% / 0.0% / 0.0% | 0.0% / 0.0% / 0.0% | | **METIS (拡張版)** | n/a / n/a / n/a | n/a / n/a / n/a | n/a / n/a / n/a | | **Adaptive-RAG (拡張版)** | n/a / n/a / n/a | 159.2×コスト / n/a / n/a | 159.2×コスト / 1.1×コスト / n/a | | **CARROT-KNN (LLM単体)** | n/a / n/a / n/a | n/a / n/a / n/a | n/a / n/a / n/a | | **CARROT-RoBERTa (LLM単体)** | n/a / n/a / n/a | n/a / n/a / n/a | 92.3% / n/a / n/a | | **CARROT-KNN (拡張版)** | n/a / n/a / n/a | 77.0% / 6.6% / n/a | 57.5% / 29.7% / 2.2×コスト | | **CARROT-RoBERTa (拡張版)** | 2.4% / 0.0% / n/a | 59.2% / 26.9% / n/a | 44.6% / 41.9% / 2.3×コスト | | **BRANE (提案手法)** | **89.4% / 81.7% / 8.1%** | **17.3% / 88.0% / 19.1%** | **40.7% / 91.0% / 89.1%** | (Table 1. 特性抽出コストを含んだ実質削減率。n/a は当該精度に到達不能であることを示す。BRANE は全ベンチマークで厳密な 100% 精度目標を達成した唯一の手法である。) ### 特性化モデルおよび予測器のアブレーション(Table 2) クエリ特性抽出モデルおよび予測器構造を変更した際のコスト削減率(%)比較: | 手法 / 分類 | 特性抽出器・変種 | 100% 精度目標 (MuSiQue / BrowseComp+ / FinanceBench) | 95% 精度目標 (MuSiQue / BrowseComp+ / FinanceBench) | 90% 精度目標 (MuSiQue / BrowseComp+ / FinanceBench) | |---|---|---|---|---| | **BRANE** | **GPT-5-mini (既定)** | **89.4% / 81.7% / 8.1%** | **17.3% / 88.0% / 19.1%** | **40.6% / 91.0% / 89.1%** | | | GPT-5-nano | 89.2% / 0.0% / 6.7% | 17.8% / 85.7% / 8.1% | 40.0% / 82.5% / 84.7% | | | Qwen3.5-9B | 92.2% / n/a / 0.4% | 24.5% / 85.5% / 12.4% | 43.1% / 89.4% / 12.4% | | | text-embedding-3-small | 95.7% / n/a / n/a | 29.0% / 81.5% / 15.5% | 46.8% / 89.3% / 22.9% | | **E2E ファインチューニング** | BERT-Discriminative | n/a / n/a / 0.0% | 89.1% / 1.2×コスト / 0.0% | 93.9% / 1.2×コスト / 0.0% | | | BERT-Cross-encoder | n/a / n/a / n/a | 58.8% / n/a / n/a | 69.7% / 1.2×コスト / 38.3% | | | Qwen-Discriminative | n/a / n/a / n/a | 36.0% / n/a / n/a | 70.2% / n/a / 42.0% | | | Qwen-Cross-encoder | 42.0% / n/a / n/a | 82.6% / n/a / n/a | 89.8% / n/a / n/a | | | Qwen-Generative | 17.3% / n/a / n/a | 48.1% / n/a / n/a | 62.4% / n/a / n/a | (Table 2. LLM特性抽出は埋め込み表現に対し難関タスクで圧倒的に頑健であり、構成別古典的予測器は限られたデータ予算下でエンドツーエンドニューラルモデルを大きく上回るデータ効率を示す。) ## 考察 - **埋め込み対二値特性の本質的差分**: 単一ドメイン(FinanceBench 等)では、全クエリが財務質問であるため意味埋め込み空間上で極めて密に凝集し、コサイン類似度などの幾何学的距離が構成の適不適(「表の数値計算が必要か」「複数四半期の対比が必要か」等)を弁別できない。LLM によるタスク指向の述語抽出がこのセマンティックギャップを解消する。 - **古典的表形式モデルのデータ効率優位性**: 数百サンプル規模のプロファイルデータにおいては、エンドツーエンドのニューラルモデル(BERT や Qwen3-4B LoRA)は過学習や汎化不足に陥りやすい。意味理解(LLM特性化)と構成選択(表形式分類器)を疎結合に分離したアーキテクチャが、高い汎化性と安定したパレート走査を実現している。 - **推論時オーバーヘッドの経済性**: クエリ特性化に伴う推論コストは最良静的構成の 4.4% 程度に収まり、パイプライン側で得られる 50〜89% のコスト削減幅に比べて十分に小さく、実運用でのペイバックが成立する。 ## 強み / 弱点・課題 ### 強み - **劇的なサービングコスト削減**: 最高精度を損なうことなく最大 89.4% のドルコストを削減。 - **モデル非依存・非侵入性**: パイプライン構成要素の内部重みや実装に手を加える必要がなく、既存の RAG / エージェントインフラにルーターとして後付け可能。 - **再訓練不要の動的トレードオフ調整**: 一度のオフラインプロファイルと予測器訓練により、$\lambda$ の調整だけで任意の SLA(精度重視またはコスト重視)に即座に適応可能。 ### 弱点・課題 - **ワークロードドリフトへの脆弱性**: プロファイル時と異なるクエリ分布(新たな質問形式や新ドメイン)が流入した場合、予測精度が劣化するため、定期的な再プロファイリングと再訓練が必要となる。 - **初期プロファイリングのコスト**: 少数百件とはいえ、全構成に対して網羅的実行を行うため初期データ収集に一定の費用(数千ドル規模)を要する。 - **レイテンシオーバーヘッド**: クエリ特性化のために LLM 呼び出しが1回先行するため、TTFT(Time To First Token)が微増する(レイテンシ制約が極めて厳しいオンライン対話では配慮が必要)。 ## 関連 - 概念: [[LLM向け情報検索]] / [[LLM推論設計空間探索]] / [[LLMエージェント]] / [[RAGノイズ除去]] / [[Retrieval-as-Reasoning]] - エンティティ: [[Melissa Z. Pan]] / [[Negar Arabzadeh]] / [[Mathew Jacob]] / [[Fiodar Kazhamiaka]] / [[Esha Choukse]] / [[Matei Zaharia]] / [[University of California, Berkeley]] / [[University of Washington]] / [[Microsoft Azure Research]] / [[BRANE]] / [[Murakkab]] / [[METIS]] / [[BrowseComp-Plus]] / [[MuSiQue]] / [[FinanceBench]] ## 出典 - [[.raw/papers/arxiv-2605.27361.pdf]](論文PDF原本) - [[.raw/papers/arxiv-2605.27361.txt]](抽出テキスト) - [arXiv:2605.27361](https://arxiv.org/abs/2605.27361)