# 世界モデル ## 定義 世界モデル(world model)とは、観測データから環境の内部ダイナミクスや遷移規則を自律的に学習し、エージェントが想像上の環境内でシミュレーション、状態予測、および行動計画(プランニング)を実行できるようにする計算モデルである。実環境での試行錯誤コストやサンプル非効率性を低減し、未観測の環境や新タスクへの迅速な適応を可能にする基盤機構として位置づけられる。([[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]] §4.15, [[@2026__arXiv__AI Must Embrace Specialization via Superhuman Adaptable Intelligence]] §5.2) ## モデルベース強化学習における内部シミュレーション - **世界モデルは方策学習のための環境シミュレータとして機能する** - 根拠: [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]] — 観測を高次元画素からVAE等で低次元の潜在状態ベクトルへ写像し、RNN等のダイナミクスモデルで潜在ベクトルの時間発展を学習した上で方策を最適化する。環境パラメータをランダム化するドメイン乱択化によって、モデル化誤差が悪用されるModel Exploitationを防ぐ。 - 根拠: [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]] — MuZeroのように環境ルールやシミュレータの事前知識を一切与えずに世界モデルを学習し、モンテカルロ木探索と組み合わせることで囲碁・将棋・チェスからAtariゲームまで統一的に制覇できる。 ## 潜在空間予測によるゼロショット適応と計画 - **画素やトークンの直接復元ではなくコンパクトな潜在空間でのダイナミクス予測が長期的計画を可能にする** - 根拠: [[@2026__arXiv__AI Must Embrace Specialization via Superhuman Adaptable Intelligence]] — 物理世界は極めて高次元かつ確率的であり、画素レベルや次トークンレベルの自己回帰的予測は予測ホライズンに伴って誤差が指数関数的に発散する。Dreamer 4、Genie 2、JEPA(Joint Embedding Predictive Architecture)のように潜在空間で状態表現と予測を行うアーキテクチャが、世界モデルによるシミュレーションと少数ショット・ゼロショットタスク適応の中核となる。 ## 未解決の問い - 実世界の高次元・確率的な環境において、潜在表現の崩壊を防ぎつつ制御に必要な情報のみを抽象化する世界モデルの汎用的損失関数は何か。 - 自己回帰型LLMのコンテキスト内推論と、世界モデルを用いた明示的なロールアウト探索(モンテカルロ木探索や潜在計画)はどのように統合されるべきか。 - 特化型エージェントの世界モデルと、広範な基礎知識を持つ基盤世界モデルとの間で、状態遷移ダイナミクスをどのように転移・合成できるか。 - 世界モデルの訓練データ収集において、内発的動機(予測誤差や新奇性)による能動的知覚と、外部タスク報酬による目的指向行動はどのように動的配分されるべきか。 ## 未編纂の観察 - **世界モデルの抽象度**: 『ディープラーニングを支える技術〈2〉』第4章がVAE+RNNによる古典的なモデルベースRLとして定式化した世界モデルは、[[@2026__arXiv__AI Must Embrace Specialization via Superhuman Adaptable Intelligence]] において、自己回帰型言語モデルの指数的発散誤差を克服し、超人的適応知能(SAI)のゼロショット計画・高速適応を支える非生成・潜在予測基盤(JEPA等)へと位置づけが更新されている。(Source: [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]], [[@2026__arXiv__AI Must Embrace Specialization via Superhuman Adaptable Intelligence]]) - [潜在空間予測によるゼロショット適応と計画] 観察学習(System A)が提供する状態予測や潜在表現と、行動方策(System B)が提供する能動的データ収集を、低次元メタ状態(不確実性や予測誤差)に基づくメタ制御(System M)が動的にルーティングすることで、エージェントは模倣学習における外求・自己視点変換(exo-ego retargeting)や推論時の心的シミュレーション・空想を自律的に実行できる (Source: [[@2026__arXiv__Why AI systems don’t learn and what to do about it]])。 ## 関連 - [[強化学習]] — モデルベース強化学習の文脈 - [[自己教師あり学習]] — 潜在空間予測(JEPA)との接続 - [[AGI]] — 汎用知能の実現アプローチを巡る論争 - [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 4 深層強化学習]] - [[@2026__arXiv__AI Must Embrace Specialization via Superhuman Adaptable Intelligence]] - ソース: [[@2026__arXiv__Why AI systems don’t learn and what to do about it]] - 概念: [[自律学習]] / [[メタ制御]] ## 出典 - 岡野原大輔, 『ディープラーニングを支える技術〈2〉 ニューラルネットワーク最大の謎』, 技術評論社, 2022, 第4章, §4.14-§4.15. - [[@2026__arXiv__AI Must Embrace Specialization via Superhuman Adaptable Intelligence]] - [[@2026__arXiv__Why AI systems don’t learn and what to do about it]](観察学習System Aと行動学習System Bを調停する世界モデルの役割と模倣学習・心的シミュレーション機構)