# LLMのデータ枯渇に関するサーベイ 本ページは19本のソースを横断し、LLMの訓練データ枯渇という主題の地図を作る。 想定読者は事前学習のデータ調達と拡張を設計する実務者と研究者である。 数値は評価条件つきで引き、異なる評価設定の数値を同一の表で比較可能には並べない。 全主張の末尾に出典を付け、wikiのソースに書かれていない数値と主張は書かない。 全体像を最短で得たいなら第2章と第8章、緩和策の設計に興味があるなら第4章から第6章を読む。 ## 設問 「LLMのデータ枯渇問題に関するサーベイ文書を作成して」 ## 本サーベイのスコープ 本サーベイはテキスト事前学習データの枯渇予測とその緩和策を扱う。 画像と動画のストック推定には立ち入らず、Villalobosらの表1が点推定を示す事実に触れるだけにする。 RAG向け検索基盤のような下流利用の課題は扱わない。 姉妹ページは存在しないため、他ページへ譲る範囲は無い。 ## 第1章 なぜデータ枯渇が問題になるか 大規模学習の隘路は計算資源から人間が生成するデータ量へ移りつつある。 菊田遥平の解説はこの枠組みを提示し、根拠として計算機の性能向上を挙げる。 NVIDIA A100(2020年)に対するB200(2024年)の比はFP16演算性能5.6倍、メモリー容量2.4倍、メモリー帯域幅4.1倍である。 (Source: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則]]) 人類が生み出すデータの速度が劇的に変わる可能性は低く、データ量の限界が生成AI進化の隘路になりうる。 (Source: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則]]) ボトルネックの叙事は時期により異なる。 岡野原大輔の2022年の記述はWellingの条件付き論を紹介し、データ豊富な問題では計算が隘路になり、データ不足と外挿必要時はデータ取得が問題になると述べる。 (Source: [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 5 これからのディープラーニングと人工知能]]) 2025年の解説はVillalobosらの試算を根拠に隘路の移動をより断定的に述べる。 (Source: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則]]) Villalobosら(Epoch AI)の予測は需要と供給の交点として2026年から2032年、中央値2028年の枯渇を定量化する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 母集団の年代分布は2020年の法則発見から2026年の対処実証へ向かう。 Kaplanら(OpenAI)とHenighanら(OpenAI)が2020年にべき乗則を示し、2022年にVillalobosらの枯渇予測とHoffmannら(DeepMind)のChinchilla則が出た。 (Source: [[@2020__arXiv__Scaling Laws for Neural Language Models]]、[[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling]]、[[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]、[[@2022__arXiv__Training Compute-Optimal Large Language Models]]) 2024年にDataComp-LMがキュレーションの競技基盤を作り、2025年に制約下則と合成則の大規模実証が並び、2026年に動的選択と日本語での合成実証が出た。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]、[[@2025__JMLR__Scaling Data-Constrained Language Models]]、[[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、[[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]、[[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 以降の章を読む座標が第2章である。 ## 第2章 分類の4軸 母集団の全文献を配置する座標系として4軸を立てる。 第3章以降はこの軸の値で章を切らず、問いの層に沿って章を切る。 各章の文献が4軸のどこに位置するかを示すことが本章の役割である。 ### 軸1 問いの層 | 値 | 内容 | 代表文献 | |---|---|---| | ストック予測 | 利用可能な人間生成テキストの総量と枯渇時期の推定 | [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]] | | 制約下の振る舞い | 有限データを反復と混合で使うときの損失と性能 | [[@2025__JMLR__Scaling Data-Constrained Language Models]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]] | | 緩和策の効果 | 合成と選択が実効データ量と効率をどう変えるか | [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、[[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]、[[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]] | | 副作用と限界 | 崩壊と容量上限という代償 | [[joisino-モデル崩壊と多様性-2026]]、[[joisino-言語モデルの物理学-2025]] | ### 軸2 データ出自 | 値 | 内容 | 代表文献 | |---|---|---| | 人間生成ウェブ | Common Crawl、FineWeb、RefinedWebなどの公開クロール | [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]、[[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]] | | コード | The Stack Pythonなどのプログラムテキスト | [[@2025__JMLR__Scaling Data-Constrained Language Models]] | | 合成リフレーズ | 既存文書の書き換えによる派生データ | [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]] | | 合成純生成 | 文書に逐語接地しない新規生成データ | [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、[[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]] | | 厳選高品質 | フィルタと選択で残した部分集合 | [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]、[[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]] | ### 軸3 緩和策の系統 | 値 | 内容 | 代表文献 | |---|---|---| | 反復 | 同一データの複数エポック学習 | [[@2025__JMLR__Scaling Data-Constrained Language Models]] | | 混合 | コードなど別出自データの混入 | [[@2025__JMLR__Scaling Data-Constrained Language Models]]、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]] | | 合成 | 生成データの混入 | [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、[[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]] | | 選択 | 品質と効用による選び分け | [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]、[[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]] | | 転移 | 別言語と別様式からの転用 | [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]] | 転移の値は実証が薄く、Villalobosらの定性的議論と翻訳実験の部分結果だけが載る。 この薄さは第9章の未解決の問いに送る。 ### 軸4 評価軸 | 値 | 内容 | 代表文献 | |---|---|---| | 損失 | ホールドアウト損失とパープレキシティ | [[@2025__JMLR__Scaling Data-Constrained Language Models]]、[[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]] | | 下流ベンチマーク | MMLU、llm-jp-eval、MATHなどの課題性能 | [[@2022__arXiv__Training Compute-Optimal Large Language Models]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]、[[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]、[[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]] | | 汚染と分布検査 | 重複検査とユニグラム分析 | [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]、[[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]] | 損失と下流性能は対応しない場合があり、同一の表で比較可能には並べない。 この非対応は第7章のベンチマーク解離と第8章の発見8で扱う。 ## 第3章 ストック予測とその不確実性 本章は人間生成テキストの総量推定と枯渇時期予測を整理する。 中核はVillalobosら(Epoch AI)の2022年プレプリントであり、2024年の改訂版まで含めて引用する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) ### 推定の設計 データストックと訓練データセット量を別々にモデル化し、両者の交点年を枯渇年と定義する。 全変数を対数正規分布とし、モンテカルロシミュレーションで95パーセント信頼区間を報告する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) ストック推定は2系統でクロスチェックする。 第1系統はGoogle索引サイズを起点とする式であり、第2系統は利用者数と1人あたり生成量からの推定である。 直接計測が困難なためである。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 需要予測は歴史的トレンド外挿と計算量ベース外挿の等重み混合である。 単一モデルへの過度な依存を避ける動機による。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 中心的な前提は人間生成公開テキストの生成過程に大きな変化が無いことである。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) ### ストックの数値 Google索引サイズ推定は2500億ページ、95パーセント区間は1000億から1兆2000億ページである。 推定手法はvan den Boschらの2016年手法の複製である。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) Common Crawlのページあたり平均プレーンテキストは7000バイト、区間は6100から8200バイトである。 1トークンを4バイト、区間を2から5バイトとして換算する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) インデックス化ウェブの生ストックは510兆トークン、区間は130兆から2100兆トークンである。 成長率は年0から10パーセントと置き、IPトラフィック成長上限と利用者成長とリンク切れ率から設定する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 2024年の年間生成量はSNSとメッセージング統計から180兆から500兆トークンと推定する。 ウェブ全体の総ストックは3100兆トークン、区間は1900兆から5200兆トークンである。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) ![[_attachments/arxiv-2211.04325/table01-web-data-stock-estimates.png]] **表3-1**:Common Crawlと索引ウェブとウェブ全体の中央値と95パーセント区間を示す。画像と動画は点推定だけである。本文の510兆と3100兆という数値はこの表の中央値に対応する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]、表1) 品質調整後ストックは100兆トークン、区間は22兆から490兆トークンである。 重複除去後の10から40パーセントが高品質という見積もりを使い、根拠はRefinedWebの約30パーセント削減とパープレキシティ剪定の約50パーセント削減の実証である。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 反復調整後ストックは320兆トークン、区間は65兆から1700兆トークンである。 多エポックの上限を5倍に抑制して適用する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) ### 需要と枯渇年 歴史的データセット量成長率は年0.38桁、約2.4倍であり、区間は0.27から0.48桁である。 2010年から2024年の主要LLM約80件の対数線形回帰による。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 計算量ベース需要はChinchilla則のパラメータあたり20トークンを計算量成長予測に適用する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 当時の最大データセットは約10兆トークンであり、PaLM 2約4兆、DBRX 12兆、Llama 3は15兆トークンと図に記録する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 枯渇中央値年は2028年、区間は2026年から2032年である。 枯渇時点のデータセット量は約\(4\times10^{14}\)トークン、訓練計算量は約\(5\times10^{28}\)FLOPと図に示す。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) ![[_attachments/arxiv-2211.04325/fig01-effective-stock-projection.png]] **図3-2**:実効ストック予測とデータセット量予測の交点が枯渇中央値年を示す。5倍オーバートレーニングの破線は枯渇が1年早まる。本文の2028年と約\(4\times10^{14}\)トークンという数値はこの交点に対応する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]、図1) 2025年以降のフロンティアがChinchilla最適の5倍トークン比で訓練する仮定では枯渇が1年早まり、計算量は約\(6\times10^{27}\)FLOPになる。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 非公開データを足しても効果は限定的である。 主要プラットフォーム各約1千兆トークン、合算最大3千兆トークンを見込むが、枯渇時期は1年半ほど遅延するだけである。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) ### 著者自身が認める限界 1人あたり生成率の将来一定を仮定し、文化と経済要因の変動を考慮しない。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) Google索引サイズが過去10年ほぼ横ばいという観測があり、理由はリンク切れ相殺と意図的索引管理と地域バイアスの仮説段階である。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 性能向上に必要な質とタスク適合度は定量化されず、技能別の不足は今後の課題と明記する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 合成データと転移学習の定量的寄与は示さず、定性的議論にとどめる。 合成データには崩壊の危険があり、非公開データには機微と法務の危険と分散という困難がある。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) 有償の大量人間テキスト生成は経済的に非現実的であり、付録は1000万人規模でもCommon Crawl相当に数千億ドル規模の人件費と試算する。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) > [!contradiction] 需要側モデルの粒度 > 菊田遥平の解説は需要を学習時演算量の0.5乗というべき乗則だけで記述し、おおよそ2028年と点推定する。 > (Source: [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則]]) > Villalobosらの原論文は歴史的トレンド外挿と計算量ベース外挿の等重み混合を最終予測とし、中央値2028年と区間2026年から2032年を示す。 > (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) > 書籍の記述は入門向けの圧縮であり、不確実性と混合モデルを落としている。 > 枯渇年を引用するときは原論文の区間つき数値を使う。 ## 第4章 制約下のスケーリング則 本章はユニークデータが有限という条件で最適配分がどう変わるかを整理する。 出発点は無限データを仮定した古典則であり、到達点は反復と混合の実証である。 ### 古典則の三つの姿 Kaplanら(OpenAI)の法則は損失が規模にべき乗で従うことを示す。 指数はモデル0.076、データ0.095、計算0.050である。 固定計算量下では大きなモデルを早期停止する配分が最適であり、モデル指数0.73、データ指数0.27になる。 (Source: [[@2020__arXiv__Scaling Laws for Neural Language Models]]) 実験条件はWebText2の22.9億トークン、非埋め込み768から15億パラメータ、文脈長1024である。 評価はWebText2テストと書籍とCommon Crawlと英語WikipediaとInternet Booksで行う。 (Source: [[@2020__arXiv__Scaling Laws for Neural Language Models]]) Hoffmannら(DeepMind)のChinchilla則は等比率配分を示す。 3手法の指数はいずれもモデルとデータが0.5前後で一致する。 Chinchillaは700億を1兆4000億トークンで訓練し、同一計算量のGopherを全評価課題で上回る。 (Source: [[@2022__arXiv__Training Compute-Optimal Large Language Models]]) ![[_attachments/arxiv-2203.15556/fig03-isoflop-curves.png]] **図4-2**:固定計算量ごとのU字損失曲線とその底を結ぶ最適配分のフロンティアを示す。右2枚の直線がモデルとデータの等比率拡大に対応する。本文の指数0.5前後という数値はこのフロンティアの傾きに対応する。 (Source: [[@2022__arXiv__Training Compute-Optimal Large Language Models]]、図3) 下流性能の条件つき数値としてMMLUの5ショット67.6パーセント、Gopher 60.0パーセント、BIG-bench平均65.1対54.4パーセントを記録する。 毒性はPerspective APIで0.087対0.081と有意差が無い。 (Source: [[@2022__arXiv__Training Compute-Optimal Large Language Models]]) Henighanら(OpenAI)の法則は言語以外への普遍性を示す。 最適モデル指数0.7前後が全様式でほぼ一定であり、データはモデルの0.4乗で劣線形に増やす。 (Source: [[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling]]) 30papersの二次解説はKaplan則の内部矛盾を強調する。 計算量則とデータ量則の外挿は約1万PF-days付近で破綻し、矛盾点は1兆パラメータと1兆トークンと損失1.7である。 (Source: [[@2026__30papers__Scaling Laws for Neural Language Models]]) > [!contradiction] 最適配分の不一致 > Kaplan則はモデル偏重の0.73対0.27を導く。 > (Source: [[@2020__arXiv__Scaling Laws for Neural Language Models]]) > Chinchilla則は等比率の0.5対0.5を導き、Kaplan則の固定学習率予定が少データ効果を過小評価したと分析する。 > (Source: [[@2022__arXiv__Training Compute-Optimal Large Language Models]]) > Henighan則の0.7はKaplan側に近く、Chinchillaの0.49と対立する。 > (Source: [[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling]]) > 配分指数を引用するときは前提の訓練予定とデータ条件を併記する。 ### 反復の実証 Muennighoffら(Hugging Face)のJMLR論文は反復価値の減衰を式に織り込む。 訓練トークンをユニーク量と反復回数に分解し、有効量への指数飽和で置換する。 反復ゼロで通常のChinchilla式に一致する設計である。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 過学習回避のため訓練損失でなくホールドアウトテスト損失を主指標に採る。 反復時に訓練損失が不適切になることを示したためである。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 規模は400超実行、1000万から87億パラメータ、最大9000億トークン、最大1500エポックである。 条件はGPT-2構成とC4部分集合である。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) ユニーク1億制約ではChinchilla最適の20倍から60倍の反復拡大が損失を50パーセント超も削減する。 計算量は約7000倍である。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 87億を4エポックで訓練した損失は1エポックの1780億ユニークに対しわずか0.5パーセント悪化する。 半減期定数は約15であり、16エポック相当までは悪化が穏やかで、超えると急速に悪化する。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 200エポック付近の二重降下は外れ値として除外して当てはめる。 重複除去済みC4の最適反復は59エポックである。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 実規模検証は250億ユニークと\(9.3\times10^{21}\)FLOPの配分であり、Chinchilla配分より27パーセント小さいモデルが低損失と高下流性能を示す。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) データ制約下の最適配分はエポックをパラメータより速く増やす。 過剰パラメータのほうが反復データより速く価値を減衰させるためである。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) ### 混合の実証 コード混合はPythonを0から90パーセントまで10段階でC4に混ぜ、840億トークン共通予算で評価する。 Python50パーセントまで自然言語課題性能は劣化せず、実効データ量が2倍になる。 評価は19自然言語課題の0から5ショット114スコア正規化平均である。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) コード2倍と4エポック反復の組み合わせは実質8倍相当と見積もる。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 著者限界として一部分だけの反復は将来課題であり、正則化による回避は未実証であり、重複除去の下流悪化の理由は仮説段階である。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) ### 非英語の制約事例 清丸ら(国立情報学研究所)のEACL論文は日本語の極端な制約を実証する。 固定720億予算で日本語オーガニックウェブは90億だけであり、残り630億の埋め方を比べる。 モデルは18億と38億と72億であり、Chinchilla最適基準の約2倍と1倍と0.5倍予算相当である。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 合成器をQwen3-14Bに統一し、言い換え4様式と指示4形式と翻訳で630億を作る。 評価はllm-jp-evalの4課題である。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 言い換えと指示形式は全規模で最良であり、追加オーガニックのオラクル設定に匹敵または上回る。 90億の8エポック反復は一貫して630億オーガニックより劣り、反復減衰の知見と整合すると本文が明記する。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) ![[_attachments/2026.findings-eacl.52/fig04-pretraining-curves.png]] **図4-1**:18億と38億と72億の事前学習曲線を示す。言い換えと指示形式の合成が全規模で上位にあり、反復だけの黒線を上回る。本文のオラクル匹敵という主張はこの並びに対応する。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]、図4) 翻訳の優位は18億で明確だが38億と72億ではほぼ消失する。 事後学習後も順位は保つが差は縮小し、16グラム重複汚染はごくわずかである。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 部分合成の270億と90億に複数エポックを足すとフル630億合成とほぼ同等になり、生成費を抑えつつ規模拡大できる。 言い換えだけが反復露出でわずかに低下し、合成種類で反復耐性が異なる可能性を示唆する。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 計算条件は合成約80ノード日、学習は規模順に約3と7と12ノード日である。 対象言語は日本語だけで合成器は単一であり、低資源言語への一般化は未検証である。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 動機の記述としてCommon Crawl集約でも日本語高品質は数百億規模にとどまり、英語の数兆規模に遠く及ばない。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) ## 第5章 合成データのスケーリング則と使い分け 本章は性質の異なる合成データをどの比率で混ぜると有効かを整理する。 リフレーズと純生成は別物として扱うことが出発点である。 ### 大規模系統実証の設計 Kangら(Meta)のEMNLP論文は1000超LLMと10万GPU時間超で3種合成を比べる。 600変種を最大30億と2000億トークンで訓練し、混合グリッドに約400、生成器比較に約200モデルを追加する。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 生成器をMistral-Instruct-7b-v0.1に統一し、Common Crawl派生の高品質書き換えと問答書き換えと10章教科書を作る。 モデルはLlama 3構成の1億から30億パラメータ、文脈長4096、有効バッチ100万トークン、スクラッチ訓練である。 評価はThe Pileの14領域とWikiText-103のホールドアウト損失である。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 則の形はデータ則とモデル則と結合則の3式であり、約700実行から推定する。 1000億当てはめの2000億外挿は誤差0.41パーセント、20億当てはめの30億外挿は誤差0.30パーセントである。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) ### 混合比率の知見 純リフレーズ単独はCommon Crawl単独より速くならない。 3分の1リフレーズと3分の2自然の混合は大予算で同一損失到達を5倍から10倍高速化する。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) データ規模では純合成が単独で優れず、混合が純合成を大きく上回る。 高品質書き換え混合は33パーセントと67パーセントの感度が低く、教科書混合は33パーセントが67パーセントを大きく上回る。 約200億トークン以降は33パーセント教科書混合が純Common Crawlを上回り、67パーセント混合は下回る。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) ![[_attachments/2025.emnlp-main.544/fig01-data-scaling.png]] **図5-1**:10億モデルのデータ規模則を示す。純教科書の破線が最も上にあり、33パーセント混合の実線が純Common Crawlを下回る。本文の比率非対称という主張はこの開きに対応する。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、図1) モデル規模では純リフレーズが大規模ほどCommon Crawlを下回る。 リフレーズ混合の有利比率はデータ規模とモデル規模で逆転し、教科書33パーセントの優位は大規模ほど縮小する。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 既約損失の推定では合成含み混合が純Common Crawlより低く、33パーセント高品質書き換え混合が最も低い。 純問答書き換えだけが純Common Crawlに次いで高い。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 10段階グリッドの最適比率は高品質書き換えが規模通じて約30パーセントに収束し、先行の50パーセント提案を上回る。 問答書き換えは小規模約50パーセントから大規模約30パーセントへ減少し、教科書は小規模5パーセント未満から規模とともに増えるが一貫してリフレーズより低い。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 生成器能力のアブレーションでは8B生成が3B生成を一貫して上回り、70Bは8Bを上回らない。 高品質書き換えでは70Bが一貫して悪化し、問答では70Bと8Bが同程度である。 条件は固定10億下流と50億訓練である。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 著者限界として3種合成だけが対象であり、評価は損失中心であり、単一事前学習段階だけであり、30億と2000億が上限であり、トークナイザ差の影響は細粒度で無視できない可能性がある。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) ### 数学合成のスケーリング則 Qinら(Microsoft)のCOLM論文は数学合成が修正則に従うことを示す。 Fineweb-Eduから52万数学文書を絞り、3水準の質問生成で計740万サンプルを作る。 質問器はMistral-Large-Instruct-2407、回答器はQwen2.5-Math-72Bであり、回答検証は行わない。 (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) 学習はLlama-3.2-1BとLlama-3.2-3BとLlama-3.1-8Bへの継続学習であり、評価はMATH誤り率を中心とする公開ベンチマークである。 (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) 修正則の減衰指数は1Bが0.34、3Bと8Bが0.51である。 45億合成トークン時点の予測誤り率は30億モデルが40.0パーセント、80億モデルが28.7パーセントである。 約3000億トークン超で向上が逓減し、上限到達は30億モデルが約4兆、80億モデルが約1兆トークンと推定する。 (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) ![[_attachments/arxiv-2503.19551/fig01a-scaling-curve-1b.png]] **図5-2**:10億モデルの修正則当てはめを示す。式中の減衰指数0.34と既約項18.52が本文の数値に対応する。実測点が曲線に沿い、予測可能性を裏づける。 (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]、図1) 水準比較では第2と第3水準が第1水準を全ベンチマークで上回り、表の性能はGSM8K 92.1パーセントとMATH 71.3パーセントである。 コード予備実験も3水準統合が第1水準だけを大きく上回る。 (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) 著者限界として数学中心であり、回答検証が無く、当てはめ点が7点程度であり、文書あたり質問が5問と3問で少なく、数学とコード以外は今後の課題である。 (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) ### サーベイ側の整理 LLM×DATAサーベイの第2.3章は合成の動機を5項目に整理し、毒性などの継承増幅を冒頭で警戒する。 事前学習の代表例としてWRAPを挙げ、Pileで3倍高速と50パーセント低パープレキシティと記録する。 中国語科学QAの例では雑音率30パーセント未満なら合成比率20パーセントが最適と記録する。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]]) パイプライン比較ではRefinedWeb最終残存11.67パーセント、DCLM基準1.4パーセント、FineWeb15兆トークンを記録する。 設計原則は品質と量の交換と操作依存と軽処理優先の3項目である。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]]) > [!contradiction] 単独効果の緊張 > サーベイのWRAP記述はPileで3倍高速と50パーセント低損失を達成と述べる。 > (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]]) > EMNLP実証はリフレーズ単独が自然単独より速くならないと述べ、混合で5倍から10倍高速化と述べる。 > (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) > 実験条件と混合の有無が異なるため、単独の速さを一般化して引用しない。 > [!contradiction] 最適比率の非一様性 > 中国語科学QAでは20パーセントが最適と記録する。 > (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]]) > EMNLP実証の高品質書き換えは約30パーセントに収束し、問答は50から30パーセントへ移り、教科書は5パーセント未満から増える。 > (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) > 数学合成は混合比率実験を持たない。 > (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) > 最適比率は合成の性質と領域と規模の関数であり、単一値として引用しない。 > [!contradiction] 純生成の位置づけ > 数学合成は純合成が修正則で予測可能に伸びると述べる。 > 条件は継続学習と課題ベンチマークである。 > (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) > ウェブ系実証は純合成単独がCommon Crawl単独に優れず混合が鍵と述べる。 > 条件はスクラッチ事前学習と損失評価である。 > (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) > 両者は学習段階と領域と指標が異なるため、対立ではなく条件分けで読む。 ## 第6章 選択とキュレーションによる効率化 本章はトークン量でなくトークン品質で効率を上げる系統を整理する。 静的事前絞り込みと動的逐次選択は補完関係にある。 ### 動的選択の実証 Wangら(上海交通大学)のOPUSは効用を更新空間で定義する。 候補の限界効用を実効更新と検証勾配の内積で近似し、SGDとAdamWとMuonの前処理子を使い分ける。 既存動的選択が生勾配で暗黙にSGD幾何を仮定するずれを正す動機である。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) プロキシ分布はBENCH-PROXY(検証整合プロキシ)としてベンチマーク検証集合とコーパス文書の埋め込み近傍で作る3000万トークン固定プールである。 素のホールドアウトが下流分布を捉えにくく、生検証データが不安定なためである。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) GhostとCountSketchで勾配の明示構成を避け、Boltzmann選択と冗長性罰で多様性を保つ。 追加オーバーヘッドは4.7パーセントであり、素朴実装の3.5倍超低下を解消する。 条件はGPT-2 XLのFineWeb300億学習である。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) 10ベンチマーク平均はランダム比2.2ポイント増であり、8倍の計算削減に相当する。 表の条件はゼロショット多肢選択とパープレキシティである。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) GPT-2 XLとMuonのFineWeb300億ではOPUS平均41.75が600億ランダム平均41.29に匹敵し上回る。 FineWeb-Eduのscore-3区分だけからの選択も最良静的を上回る。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) ![[_attachments/arxiv-2602.05400/fig01-overview-performance.png]] **図6-1**:学習トークンに対する平均性能を示す。OPUSの赤線が全静的選択と動的選択を上回り、300億で600億から2000億のランダムを上回る。本文の8倍効率という主張はこの到達に対応する。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]、図1) 継続事前学習ではQwen3-8B-BaseとSciencePedia30億プールで5億選択が30億全量を上回り、6倍の効率になる。 評価はOlympicArenaとSciAssessである。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) アブレーションは貪欲選択が1.26ポイント減、標準プロキシが0.72ポイント減である。 最良ハイパーパラメータはバッファ64と温度0.9と射影8192次元である。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) 著者限界として15億までの事前学習と80億継続だけであり、Muon近似の安定は未明示であり、プロキシ構築に検証集合が要り、混合拡張は将来課題である。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) ### 静的キュレーションの競技基盤 Liら(ワシントン大学を中心とする多機関)のDataComp-LMはレシピ固定でデータだけを変える基盤である。 2000億文書240兆トークンの共通プールから416件の基準実験で比べ、53課題で評価する。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 基準パイプラインはヒューリスティックとBloom重複除去とfastTextの3段であり、最終残存は1.4パーセントである。 正例に伝統高品質でなく命令形式データを採る設計判断が要点である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 7種比較の表ではfastTextがCORE 22課題30.2とEXTENDED 53課題15.4で最良である。 条件は10億の1倍計算量である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 正例と閾値のアブレーションではOH-2.5とELI5由来の命令形式正例の上位10パーセントがCORE 41.0とMMLU 29.2で最良であり、命令形式で3.5ポイント増になる。 条件は70億の1倍計算量である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 小規模の順位は大規模へ相関0.838から0.982で転移する。 条件は10手法の4億と10億と30億から70億への比較である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) ![[_attachments/19e4ea30dded58259665db375885e412-Paper-Datasets_and_Benchmarks_Track/fig03-rank-consistency.png]] **図6-2**:小規模と70億規模の順位一致を示す。対角線上に手法が並び、小規模での反復が大規模の方針決定に使える。本文の相関0.838から0.982という数値はこの一致に対応する。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]、図3) 最終70億は2兆6000億学習でMMLU5ショット64パーセントであり、公開比較対象を40パーセント少ない計算で6.6ポイント上回る。 4兆1000億データセットと2兆5000億学習の拡大も行う。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 混合の表では低性能クロールへの混合が1.4から2.2ポイント増、DCLM-BASELINEへの混合が1.2ポイント減である。 条件は10億の1倍計算量である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 抽出方式の表ではresiliparseとtrafilaturaがWET比2.5ポイント超増であり、一方は8倍高速である。 汚染除去の表ではMMLU 51.8から52.7へ低下しない。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 著者限界として70億超未検証であり、実行ばらつき未検証であり、単一トークナイザであり、公正と多言語と安全は今後であり、符号と数学は相対的に弱い。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) ### 処理分類の全体像 LLM×DATAサーベイの第2.1章は取得と重複除去とフィルタの3段を分類する。 取得は3手法、重複除去は完全除去対再重み付けと4検知系統、フィルタは標本水準対内容水準である。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]]) 数値例としてWEBIEとReFinEDの160万文の実体リンク、接尾辞配列50トークン閾値、LSHBloom偽陽性率10万分の1、CogVideoXの約3500万本の高品質6秒動画、Wanの事前処理で約50パーセント除去を記録する。 いずれも条件記載なしの引用値である。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]]) パープレキシティ効果はデータセット依存であり、PileとDolmaで逆傾向になる。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]]) 第2.2章は選択3系統と混合4系統を分類する。 選択の核心は分布符号化、混合の核心は低費最適配分である。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]]) 数値例としてREGMIXの混合予測の1割計算、D-CPTの継続コスト95パーセント超削減、数学1.9パーセントから24パーセント以上とコード15パーセントから20パーセント以上への比率変更を記録する。 いずれも条件記載なしの引用値である。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]]) 第4章は課題側から選択と評価を裏づける。 課題4.1.1は適応的自動選択の開発を方向づけ、課題4.1.2はFineWeb構築の70超10億モデルと8万H100時間という試行錯誤費を示す。 課題4.1.4は品質判定が訓練後推測という間接高費過程であることを指摘する。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]]) > [!note] 分類と実装のずれ > 第2.2章の表は最適化準拠選択を主に微調整段階と記す。 > (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]]) > OPUSは事前学習逐次での最適化準拠動的選択である。 > (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) > 分類表の段階ラベルを実装の適用可否と読み替えない。 ## 第7章 崩壊と容量という副作用 本章は緩和策の代償を整理する。 合成の反復利用は分布を痩せさせ、記憶には上限がある。 ### 崩壊の機構 佐藤竜馬の2026年記事は反復訓練の情報希薄化を論じる。 N個訓練の出力を次世代N個訓練に使う循環では、低頻度表現が一度抽出漏れすると永久消失し、分布は真分布の凸包内側へ収縮する。 (Source: [[joisino-モデル崩壊と多様性-2026]]) 貪欲復号は最高確率だけを出すため分布を平準化する。 理論例として自然15パーセントの関西弁表現が貪欲復号で0パーセントになりうる。 (Source: [[joisino-モデル崩壊と多様性-2026]]) 品質フィルタは境界の多様表現を系統除去する。 理論例として80点無難が79点奇抜に常に勝つ。 (Source: [[joisino-モデル崩壊と多様性-2026]]) 逆説としてベンチマーク改善と多様性喪失が並行しうる。 品質向上に見える得点改善が均質化の反映という場合がある。 (Source: [[joisino-モデル崩壊と多様性-2026]]) 数理上界として全世代累積で余分損失を円周率二乗の6分の1倍に抑制できる。 条件は線形モデルであり、実モデルへの適用は限定的と記事が留保する。 (Source: [[joisino-モデル崩壊と多様性-2026]]) 人間への波及としてGPT語の発話増加と多用群の中立回答70パーセント増を挙げる。 二段階縮小という構図である。 (Source: [[joisino-モデル崩壊と多様性-2026]]) 緩和3手段はいずれも限界を持つ。 全量累積は無限データ要、多様なプロンプトは有限容量で解消にならず、人間創作はAI拡大と逆行する。 (Source: [[joisino-モデル崩壊と多様性-2026]]) 結論として現行規模は人類多様性の内包に小さすぎ、作り続けることが解決策と主張する。 (Source: [[joisino-モデル崩壊と多様性-2026]]) ### 種類依存という限定 大規模単一巡回訓練では崩壊予測の当たり方が合成種類で分かれる。 リフレーズは予見可能規模で劣化を示さず、教科書混合は崩壊予測模様に合致する。 条件は1000超LLMのスクラッチ事前学習と損失評価である。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 合成含み混合の既約損失は純Common Crawlより低い推定になり、常に劣化という予測への反例になる。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) ![[_attachments/2025.emnlp-main.544/fig03-irreducible-loss.png]] **図7-1**:混合別の既約損失推定を示す。純Common Crawlの棒が最も高く、33パーセント高品質書き換え混合が最も低い。本文の反例という主張はこの逆転に対応する。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、図3) 未解決として種類差の機構が残る。 (Source: [[モデル崩壊]]) ### 容量の上限 Allen-Zhuら(Meta)のPhysics of Language Models計画の第3.3部は知識容量則を示す。 佐藤竜馬の2025年解説が6論文体系で紹介する。 (Source: [[joisino-言語モデルの物理学-2025]]) 架空伝記の統制実験でパラメータ1個あたり約2ビットの三つ組知識を記憶する。 GPT-2とLlamaとMistralで一貫し、地名と社名の数を変えても変わらない。 (Source: [[joisino-言語モデルの物理学-2025]]、[[知識容量スケーリング則]]) 量子化では8ビットで容量ほぼ不変であり、理論上限の約25パーセント有効活用になる。 4ビットでは効率が2倍超悪化し、効率面の最適は8ビットである。 (Source: [[joisino-言語モデルの物理学-2025]]、[[知識容量スケーリング則]]) 使い捨て伝記の混入は容量を20倍超悪化させる。 重要先頭の特殊トークンだけで悪影響が消え、品質が容量に直接大きく効く。 (Source: [[joisino-言語モデルの物理学-2025]]、[[知識容量スケーリング則]]) 実務含意として7Bの約140億ビットは英語Wikipedia総知識を超える。 必要量既知なら約2倍のパラメータ数が目安になる。 (Source: [[joisino-言語モデルの物理学-2025]]、[[知識容量スケーリング則]]) 貯蔵と操作は独立能力であり、伝記暗記だけでは問答抽出が10パーセント未満にとどまる。 提示順攪拌の5種伝記で96.6パーセントに上がる。 順序違い抽出は20パーセント程度に落ち、操作課題は連鎖思考なしに解けない。 (Source: [[joisino-言語モデルの物理学-2025]]) > [!warning] ベンチマークと多様性の解離 > 得点改善が分布均質化の反映という場合があり、得点だけでは多様性喪失を検出できない。 > (Source: [[joisino-モデル崩壊と多様性-2026]]、[[モデル崩壊]]) > 引用する数値は理論例と線形上界という射程つきであり、実モデルでの崩壊率として引用しない。 ## 第8章 横断的な発見 本章は単一文献では言えないことだけを書く。 単一文献の事実は第3章から第7章に置いた。 ### 発見1 反復と合成は排他でない コード混合2倍と4エポック反復の8倍見積りは、別出自の水増しと同一出自の使い回しが積めることを示す。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 部分合成に複数エポックを足してフル合成に迫る結果は、生成水増しと反復が積めることを示す。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 2件を並べると、実効データ拡張は単一路線でなく系統の積み上げで設計できる。 言い換えだけの反復低下という留保つきである。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) ### 発見2 最適混合比率は一様でない 高品質書き換えの約30パーセント収束と問答の50から30パーセント減少と教科書の5パーセント未満起点は、同一論文内の規模別非一様である。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 中国語科学QAの20パーセント最適は別領域の別値である。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]]) 2件を並べると、最適比率は合成の性質と領域と規模の関数であり、定数引用は設計を誤らせる。 ### 発見3 生成器大型化は単調でない 8B生成が3B生成を上回りつつ70Bが8Bを上回らない結果は、大きい生成器ほど良いという直観を崩す。 高品質書き換えの70B悪化つきである。 条件は固定1B下流と5B訓練である。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 数学合成は生成器規模のアブレーションを持たない。 (Source: [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) 2件を並べると、生成器選定は規模でなく実測で決めるほかない。 ### 発見4 品質の定義は直感とずれる 命令形式正例の3.5ポイント増は、Wikipedia的権威より問答形式が効くことを示す。 条件は7Bの1倍計算量である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) パープレキシティ効果のPileとDolmaの逆転は、単一指標の一般化を戒める。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]]) 検証整合プロキシの0.72ポイント増は、プロキシ設計が結果を左右することを示す。 条件はGPT-2 XLのFineWeb300億である。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) 3件を並べると、高品質は自明でなく評価設計と一体で決まる。 ### 発見5 小規模で方針を決める流儀が静動双方に現れる 順位相関0.838から0.982の転移は、静的絞り込みの方針決定を小規模で済ませる根拠である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 混合予測の1割計算は、混合比率の探索費を抑える同型の流儀である。 (Source: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]]) 動的選択の80億継続示唆は同方向だが、数百億規模への外挿は未検証という留保つきである。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) 3件を並べると、枯渇下の探索費自体を抑える設計が共通解になる。 ### 発見6 崩壊は種類により証拠が分岐する リフレーズの非劣化と教科書混合の予測合致は、同一実証内の分岐である。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 一般理論の分布収縮と不可逆性は種類を問わない形で述べられる。 (Source: [[モデル崩壊]]、[[joisino-モデル崩壊と多様性-2026]]) 2件を並べると、崩壊は一様な運命でなく合成様式との相互作用であり、機構解明が残る。 ### 発見7 高品質化済みへの追加操作は有害になりうる DCLM-BASELINEへの混合1.2ポイント減は、絞り済みへの足し算の害である。 低性能側への混合増と対照的であり、条件は1Bの1倍計算量である。 (Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]) 67パーセント教科書混合の純Common Crawl割れは、比率過多の害の同型例である。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) 2件を並べると、良いものの足し算は常に良いのでなく、済み状態での追加は疑うのが設計指針になる。 ### 発見8 評価軸の分岐が比較を妨げる 反復実証はホールドアウト損失を主指標に採り、下流19課題を補完に置く。 条件はC4系とGPT-2構成である。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]) 日本語実証は4課題の下流を主評価に置き、事後学習と汚染検査を足す。 条件は720億固定とllm-jp-evalである。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) 容量則は損失と課題性能に対する第三の軸として知識量を直接測る。 (Source: [[知識容量スケーリング則]]、[[joisino-言語モデルの物理学-2025]]) 3件を並べると、枯渇対策の優劣は指標をそろえないと比較できず、損失と下流と容量の3軸併記が報告の指針になる。 ## 第9章 未解決の問い - **半減期定数の依存性。** 反復価値の半減期約15という値は示したが、アーキテクチャとデータセットとトークナイザでどう変動するかは検証されていない。定式化自体が正則化の回避可能性を織り込まないためである。 (Source: [[@2025__JMLR__Scaling Data-Constrained Language Models]]、[[データ制約下でのスケーリング]]) - **合成と反復の統一記述。** 合成水増しと反復水増しを同一有効量で書けるか、合成の減衰特性はどうかは検証されていない。部分合成と反復の併用が有効という事実はあるが、式の統合には至らないためである。 (Source: [[データ制約下でのスケーリング]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) - **種類差の機構。** リフレーズと純生成で崩壊感受性が異なる理由は何かは検証されていない。単一巡回という条件での観測であり、多世代動態を見ていないためである。 (Source: [[モデル崩壊]]、[[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]) - **容量則と訓練量の関係。** 2ビット則が他領域で成立するか、同規模でも多トークン訓練で容量が増えるかは検証されていない。統制伝記という条件での知見であり、実コーパスでの対応が不明なためである。 (Source: [[知識容量スケーリング則]]、[[joisino-言語モデルの物理学-2025]]) - **非英語への一般化。** 日本語の知見が他言語で成立するか、低資源言語で流暢な合成器という前提が成り立つかは検証されていない。単一言語と単一合成器という条件のためである。 (Source: [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]、[[データ枯渇]]) - **推定の独立検証。** 2028年中央値が別手法の推定でも収束するか、索引横ばいの真因は何かは検証されていない。単一系統の推定と仮説段階の原因論のためである。 (Source: [[データ枯渇]]、[[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]) - **質の定量化。** 技能別の不足と頑健な品質得点は未確立である。訓練後推測という間接高費過程と、指標の逆転という困難があるためである。 (Source: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]]) - **選択の拡張。** 混合への拡張と大規模での追加費外挿は未検証である。15億規模と80億継続という条件のためである。 (Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]) - **最先端規模の妥当性。** 合成則が100B級と10T級で保つかは未検証である。3Bと200B上限という条件のためである。 (Source: [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls]]、[[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models]]) - **転移の定量化。** 別言語と別様式の転用が枯渇制約をどれだけ相殺するかは未検証である。定性的議論と翻訳の部分結果だけのためである。 (Source: [[データ枯渇]]、[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]]) ## 第10章 文献一覧 行が文献、列が年と刊行物と組織と軸の配置である。 ページ内リンクは表示名を短くする。 | 文献 | 年 | 会議または刊行物 | 組織 | 軸1層 | 軸2出自 | 軸3系統 | |---|---|---|---|---|---|---| | [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data\|Villalobos枯渇予測]] | 2022 | arXiv | Epoch AI | 予測 | ウェブ | 転移 | | [[@2025__JMLR__Scaling Data-Constrained Language Models\|Muennighoff制約則]] | 2025 | JMLR | Hugging Face | 振る舞い | ウェブ、符号 | 反復、混合 | | [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data\|清丸日本語合成]] | 2026 | EACL Findings | 国立情報学研究所 | 振る舞い、緩和 | ウェブ、合成 | 合成、反復、転移 | | [[@2025__EMNLP__Demystifying Synthetic Data in LLM Pre-training - A Systematic Study of Scaling Laws, Benefits, and Pitfalls\|Kang合成系統]] | 2025 | EMNLP | Meta | 緩和 | ウェブ、合成 | 合成 | | [[@2025__arXiv__Scaling Laws of Synthetic Data for Language Models\|Qin数学合成則]] | 2025 | COLM、arXiv | Microsoft | 緩和 | 合成 | 合成 | | [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration\|Wang動的選択]] | 2026 | arXiv | 上海交通大学 | 緩和 | 厳選 | 選択 | | [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models\|DataComp-LM]] | 2024 | NeurIPS | ワシントン大学、多機関 | 緩和 | ウェブ、厳選 | 選択、混合 | | [[@2020__arXiv__Scaling Laws for Neural Language Models\|Kaplan則]] | 2020 | arXiv | OpenAI | 振る舞い | ウェブ | 該当なし | | [[@2022__arXiv__Training Compute-Optimal Large Language Models\|Chinchilla則]] | 2022 | arXiv | DeepMind | 振る舞い | ウェブ | 該当なし | | [[@2020__arXiv__Scaling Laws for Autoregressive Generative Modeling\|Henighan則]] | 2020 | arXiv | OpenAI | 振る舞い | ウェブ、他様式 | 該当なし | | [[@2026__30papers__Scaling Laws for Neural Language Models\|30papers解説]] | 2026 | 二次解説 | 30papers | 振る舞い | ウェブ | 該当なし | | [[@2025__Gihyo__原論文から解き明かす生成AI - Chapter 7 生成AIモデルのスケーリング則\|菊田第7章]] | 2025 | 技術評論社 | 記載なし | 予測、振る舞い | ウェブ | 該当なし | | [[@2022__Gihyo__ディープラーニングを支える技術〈2〉 - Chapter 5 これからのディープラーニングと人工知能\|岡野原第5章]] | 2022 | 技術評論社 | 記載なし | 該当なし | ウェブ | 該当なし | | [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering\|LLM×DATA2.1]] | 2025 | arXiv | 記載なし | 緩和 | ウェブ、厳選 | 選択 | | [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing\|LLM×DATA2.2]] | 2025 | arXiv | 記載なし | 緩和 | 厳選 | 選択、混合 | | [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines\|LLM×DATA2.3]] | 2025 | arXiv | 記載なし | 緩和 | ウェブ、合成 | 合成、選択 | | [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions\|LLM×DATA4章]] | 2025 | arXiv | 記載なし | 副作用、限界 | 厳選 | 選択 | | [[joisino-モデル崩壊と多様性-2026\|joisino崩壊]] | 2026 | 個人ブログ | 個人 | 副作用 | 合成 | 合成 | | [[joisino-言語モデルの物理学-2025\|joisino物理学]] | 2025 | 個人ブログ | 個人 | 副作用 | 厳選 | 選択 | ## 付録 数値引用時の注意 - 原論文の版差で数値が変わる。Villalobos予測は2022年初版と2024年改訂があり、現最大量の記述は改訂版の図による。 - 指標定義がそろわない。損失と下流得点とMATH誤り率は互換がなく、順位の比較は同一指標内だけで行う。 - 同名の対象が規模で別物になる。18億と72億の翻訳優位は規模で消え、比率最適は規模で動く。 - 評価目的が異なるモデル間の数値を直接比較しない。継続学習の課題得点とスクラッチの損失は別物であり、条件分けで読む。 ## 関連 - 概念: [[データ枯渇]] / [[合成データ]] / [[モデル崩壊]] / [[データ制約下でのスケーリング]] / [[事前学習データ選択]] / [[スケーリング則]] / [[LLMスケーリング則]] / [[知識容量スケーリング則]] / [[データキュレーション]] - MOC: [[structures/000 Index.md]]