# Dream-RSI: Recursive Self-Improvement through Evolving Worlds > [!abstract] 概要 > 自律 AI エージェントにとって再帰的自己改善(Recursive Self-Improvement; RSI)はますます不可欠になりつつあり、その進展は複雑なドメインにわたって高価値な解を発見できるかどうかにかかっている。このプロセスの推進力は効果的な探索であるが、探索戦略の管理と改善は依然として主要なボトルネックとなっている。現在のシステムは根本的なジレンマに直面している。固定的な戦略は探索空間の拡大に適応できず、一方でオンライン方針最適化は、長期ロールアウトに伴う遅延し高コストなフィードバックの下で膨大なメタ探索空間を航行する必要がある。我々は、スケーラブルかつ再帰的に自己改善する探索のためのフレームワークである Dream-RSI を提案する。軽量なオーケストレーション層によって、基盤となるコーディングエージェントを変更することなく、探索を明示的かつプログラム可能にする。我々の重要な洞察は、蓄積された発見履歴が、実現された探索空間に対するリプレイシミュレータとして機能しうるという点である。過去の発見木から構築されたリプレイシミュレータ内で「夢見(dreaming)」を実行することにより、Dream-RSI は反復的で高価なオンライン評価を呼び出すことなく、探索方針を評価・改良するための即時かつ低コストなオフポリシーフィードバックを確保する。改良された方針はその後オンラインに再デプロイされてさらなる発見を促進し、自己改善ループの中でシミュレータプールを継続的に拡大する。アルゴリズム工学、数学的最適化、GPU カーネル工学において、Dream-RSI は複数の設定で発見コストを大幅に削減しながら、同等以上の発見品質を達成する。 ## 論文情報 - タイトル: Dream-RSI: Recursive Self-Improvement through Evolving Worlds - 著者: [[Tong Zheng]], Xidong Wu, Zheng Zhang, Zhankui He, Chaoyi Zhang, Benjamin Coleman, Ruoqiao Wei, Di Bai, Haolin Liu, Rui Liu, Xue Wang, Yue Zhuan, Wang-Cheng Kang, Renkai Xiang, Heng Huang, Xinwu Cheng, [[Yunsong Guo]] - 所属: [[Google]], University of Maryland, College Park, [[DeepMind]](Google DeepMind), University of Virginia - 発表媒体: arXiv:2609.14858v1 [cs.CL] (2026-09-14) - コード: https://github.com/zhengkid/Dream-RSI - プロジェクトページ: https://dream-rsi.com ## 概要 AI エージェントによる長期的な自律発見(アルゴリズム探索、数理最適化、システム最適化など)において、探索方針(どの候補を展開し、どの深さを掘るか)の制御は極めて計算資源を消費する。従来は固定的なルール(深さ優先、最良優先など)を用いるか、メタ方針のオンライン学習に頼っていたが、後者はロールアウトと評価のコストが膨大であった。 Dream-RSI は、基盤の探索・コーディングエージェントや検証器を改変せず、探索制御(探索方針コード)のみを最適化対象とする。探索履歴を「探索空間のリプレイシミュレータ(Replay Simulator)」として構成し、シミュレータ上でオフラインの擬似実行(Dreaming)を行うことで、実際の重い評価器を回すことなく超低コストに探索方針を評価・改善する。 ## 問題設定 自律探索ループにおいて、候補解の提案と検証には長い時間と計算機資源(数千サイクルの提案・評価、GPU実機検証など)が必要となる。 探索方針を改善しようとする際、固定戦略では探索空間の拡大や局所解へのスタックに適応できない。一方、オンラインで方針を最適化しようとすると、方針の評価のために毎回オンライン探索ロールアウトを回す必要があり、フィードバックが遅延し莫大な計算コストが発生する(ジレンマ)。 ## 提案手法 Dream-RSI は、オンライン探索とオフライン「夢見(dreaming)」を交互に繰り返す再帰的自己改善フレームワークである。 **Figure 1: Dream-RSI の全体概要** ![[_attachments/arxiv-2609.14858/fig01-overview.png]] (Figure 1. システムは再帰的自己改善ループで動作する。(1) デプロイされた探索方針が基盤エージェントを誘導してオンライン探索を行い、発見木を拡張して履歴に蓄積する。(2) 実現された発見木からリプレイシミュレータを構築し、シミュレータプールを更新する。(3) リプレイシミュレータ内で方針開発エージェントがオフライン夢見(dreaming)を行い、即時フィードバックを得て方針コードを改善・検証した上で、次サイクルのオンライン探索へ再デプロイする。) 1. **発見木(Discovery Tree)と決定インターフェース**: 探索空間は、ルート $r$ を初期状態とし、各ノード $v$ が親ノードのファイルシステムスナップショット・生成成果物・検証診断結果・スコア $s_v$ を保持する木構造として表現される。探索方針 $\pi$ は、現在の観測木 $\mathcal{T}$ のフロンティア(ルートおよび葉ノード)から、並行ワーカ数 $W$ に応じたバッチノード $C \subseteq \mathcal{A}(\mathcal{T})$ を選択する Python スクリプトとして実装される。 **Figure 2: リプレイシミュレータとしての発見履歴** ![[_attachments/arxiv-2609.14858/fig02-replay-simulator.png]] (Figure 2. 過去の探索履歴 $H$ は、実際に訪問されたノード群で構成されるリプレイ世界となる。未知のノードへの展開はできないが、既知ノード間の遷移・分岐・停止判断をオフラインで忠実に再現可能である。) 2. **リプレイシミュレータ(Replay Simulator)**: モデルベース強化学習(Dreamer など)に着想を得て、過去のオンライン実行履歴 $H$ をそのまま「確定的な離散リプレイ世界」として扱う。シミュレータ内では、候補方針が選択したノードが既に過去履歴に存在すれば、即座に過去の実行結果(スコア・診断ログ)を返し、未探索ノードへの分岐はそこで打ち切る。これにより、評価器を実際に実行することなく探索方針の挙動をオフポリシーで超高速にシミュレートできる。 3. **夢見による方針改善(Dreaming-based Policy Improvement)**: LLM による方針改善エージェント(Policy-Development Agent)が、シミュレータプール上のシミュレーション結果とスケーリングカーブを観察しながら、探索方針コードそのものを改善・提案する。最もスコアの高かった方針コードが次のオンライン探索サイクルへデプロイされる。 ## 新規性 - **明示的でプログラム可能な探索方針**: エージェント本体のプロンプトやモデル重みに手を加えず、探索方針を独立した実行可能 Python コードとして分離・最適化する。 - **発見履歴の世界モデル化(Replay Simulator)**: 過去に探索された離散的な発見木を、環境のダイナミクスモデル(リプレイシミュレータ)として再定義し、オフライン夢見を通じて安価・即時に方針の良し悪しを判定する。 - **自己改善の二重ループ**: オンライン探索がシミュレータプールを豊かにし(世界モデルの拡大)、拡大した世界モデルがより優れた探索方針を育てる共進化構造を実現した。 ## 実験設定 3 つの高度な発見タスクで評価を実施: 1. **アルゴリズム工学(Algorithm Engineering)**: Lasso 正則化パス探索(Lasso Regularization-Path Discovery)。scikit-learn や glmnet を超える座標降下法アルゴリズムの発見。 2. **数学的最適化(Mathematical Optimization)**: 自己相関不等式(Auto Correlation)、円パッキング(Circle Packing)、和の差分問題(Sum Diff)。 3. **GPU カーネル工学(Kernel Engineering)**: KernelBench から VGG16、LayerNorm、ConvDiv、ConvMax の 4 つのカスタム CUDA/Triton カーネル最適化。 ## 実験結果 ### アルゴリズム工学(Lasso 最適化) **Figure 3: Lasso 正則化パス探索の結果** ![[_attachments/arxiv-2609.14858/fig03-lasso-results.png]] (Figure 3. (a) 発見されたソルバーの最終実行時間比較。sklearn および glmnet に対して大幅な高速化を達成。(b) 再帰的発見ダイナミクス。Dream-RSI は固定探索戦略と比較して、同一の計算量予算でより優れた高速アルゴリズムを発見した。) ### 数学的最適化タスク (Table 1. 数学的発見タスクにおける性能比較。Gemini-3.1-Pro を用いた場合、Dream-RSI は Sum Diff で 1.145427 を達成し、先行する進化型手法 AlphaEvolveV2 や固定探索を上回る最高性能を記録した。) | 手法 | LLM | Sum Diff (↑) | Auto Correlation (↓) | Circle Packing (↑) | |---|---|---|---|---| | AlphaEvolve | Gemini-2.0 Pro + Flash | – | 1.455700 | 2.635862 | | AlphaEvolveV2 | Gemini-2.0 Pro + Flash | 1.121936 | – | 2.635983 | | OpenEvolve | - | – | 1.460000 | - | | CodeEvolve | - | – | – | 2.635980 | | ShinkaEvolve | Mixed | – | 1.457800 | 2.635982 | | TTS-Discovery | Qwen3-8B | – | – | 2.635983 | | ThetaEvolve | Distilled-Qwen3-8B | – | 1.493000 | 2.635983 | | EvoX | Gemini-3.0-Pro | – | 1.458900 | 2.635900 | | SimpleTES | GPT-OSS-120B | 1.143975 | 1.453675 | 2.635983 | | 固定探索(ベースライン) | Gemini-3.1-Pro | 1.144047 | 1.456001 | 2.635983 | | **Dream-RSI** | Gemini-3.1-Pro | **1.145427** | 1.456375 | 2.635983 | ### GPU カーネル工学タスク **Figure 4: GPU カーネル工学タスクの発見軌跡** ![[_attachments/arxiv-2609.14858/fig04-gpu-kernel-results.png]] (Figure 4. KernelBench における 4 種のカーネル(VGG16, LayerNorm, ConvDiv, ConvMax)の最適化。Dream-RSI は固定探索と比較して、同等性能を達成するまでのコストを 1.79×〜2.43× 削減し、同一予算下で 1.44×〜2.09× 高いスループット(1/ms)を達成した。) **Figure 5: ConvDiv における履歴帰納バイアスの効果** ![[_attachments/arxiv-2609.14858/fig05-convdiv-performance.png]] (Figure 5. 過去の探索履歴を誘導として用いることで、固定探索・Dream-RSI ともに収束が加速するが、Dream-RSI は探索方針の適応によってさらに高い性能へ到達する。) **Figure 6: ConvDiv における探索行動の進化推移** ![[_attachments/arxiv-2609.14858/fig06-exploration-evolution.png]] (Figure 6. (a) 各ラウンドごとの最良性能推移。(b) 評価試行回数の推移。初期ラウンドでは幅広く試行を行い、ラウンドが進むにつれて有望な解周辺へリソースを集中的に投じる探索行動の適応が観察される。) ## 考察 - **オフポリシー評価の有効性**: リプレイシミュレータは探索空間の部分木しかカバーしていないにもかかわらず、探索方針の分岐や剪定といったメタな探索行動を洗練させるには十分な情報量を提供できる。 - **実機評価コストの大幅削減**: 高価なコンパイルや GPU 実機ベンチマークを夢見フェーズでスキップできるため、探索方針のイテレーション速度が桁違いに向上する。 - **世界モデルとの類似性**: 強化学習における World Models(Ha & Schmidhuber)の概念を、自律コーディングエージェントの探索木に拡張した実証例として位置づけられる。 ## 強み / 弱点・課題 ### 強み - 基盤モデルの再訓練や重み更新が不要で、エージェントコードも改変せずに探索方針のみを自己改善できる。 - オフラインシミュレーションにより、API 課金や実機評価時間を劇的に抑制できる。 - 多様な科学・工学ドメイン(数理・アルゴリズム・GPUカーネル)で汎用的に機能する。 ### 弱点・課題 - リプレイシミュレータは過去に訪れた状態(既知ノード)のみに制約されるため、全く未踏の領域に対する方針の汎化性能を過大評価するリスク(シミュレータの過剰適合)がある。 - 初期履歴(シミュレータプール)が貧弱な場合、夢見フェーズで得られるフィードバックの質が制限されるコールドスタート問題を抱える。