# 事後学習 ## 定義 事前学習(Pre-training)によって大量のコーパスから言語・世界知識を獲得したベースモデル(基盤モデル)に対し、指示追従、対話能力、推論能力、ツール利用、安全性などを獲得させ、実用的なアシスタントや特定タスク向けエージェントへと適応させる訓練工程の総称。 ## 事後学習の構成要素と多段階パイプライン - **事後学習は教師ありファインチューニング(SFT)と強化学習(RL)を組み合わせた段階的最適化によって構成される。** - 根拠: [[@2026__arXiv__POSTTRAINBENCH - Can LLM Agents Automate LLM Post-Training]] — DeepSeek-R1等のフロンティアモデルでは、ベースモデルに対する初期SFT、推論・検証可能報酬に基づくRL(GRPOなど)、選好最適化(DPO/RLHF)の多段階パイプラインが標準となっている。 ## 自律型エージェントによる事後学習の自動化 - **計算制約下において、LLMエージェントは狭い特定ドメインの事後学習であれば公式チューニング済みモデルを凌駕する性能を達成できる。** - 根拠: [[@2026__arXiv__POSTTRAINBENCH - Can LLM Agents Automate LLM Post-Training]] — 10時間・1基のH100 GPUという限られた資源制約下で、GPT-5.1 Codex MaxはGemma-3-4Bの関数呼び出し(BFCL)性能を89%まで引き上げ、Google公式の指示チューニングモデル(67%)を大幅に上回った。 - **汎用的な事後学習では依然として人間の専門家による広範な設計とデータキュレーションがエージェントを大きく上回る。** - 根拠: [[@2026__arXiv__POSTTRAINBENCH - Can LLM Agents Automate LLM Post-Training]] — 総合ベンチマークでは最高性能のエージェント(Claude Opus 4.6)でも平均23.2%に留まり、公式モデルの51.1%に対して大きな隔たりが存在する。 ## 未解決の問い - 自律エージェントは単一タスクの過剰適合(タスク特化)を超えて、破滅的忘却を回避しつつ汎用的な指示追従・対話・安全性を両立する事後学習を自動設計できるか? - 事後学習における推論RL(GRPO等)の報酬設計を、検証可能な正誤判定が存在しないオープンエンドなドメイン(創作文や医療対話等)へいかに自動拡張できるか? ## 未編纂の観察 - [自律型エージェントによる事後学習の自動化] 現在のフロンティアエージェントは事後学習のアルゴリズム選択としてSFTに強く偏重しており、自律的な強化学習(GRPO)の導入はClaude系エージェントが検証可能タスク(AIME、GSM8K等)に限定して試行するに留まる。(Source: [[@2026__arXiv__POSTTRAINBENCH - Can LLM Agents Automate LLM Post-Training]]) ## 関連 - ソース: [[@2026__arXiv__POSTTRAINBENCH - Can LLM Agents Automate LLM Post-Training]] - 概念: [[指示チューニング]], [[人間フィードバックからの強化学習]], [[検証可能報酬による強化学習]], [[報酬ハッキング]], [[AI研究自動化]] ## 出典 - [[@2026__arXiv__POSTTRAINBENCH - Can LLM Agents Automate LLM Post-Training]]