# 事前学習データ選択
LLMの事前学習において、限られた計算・データ予算の中でどのトークン(サンプル)をモデルの更新に使うべきかを決める取り組み全般を指す。手法は大きく、コーパス全体を学習開始前に一度だけフィルタリングする**静的選択**と、学習の各ステップでモデルの現在の状態に適応して候補を選ぶ**動的選択**の2系統に分かれる([[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]])。
## 未解決の問い
- 動的データ選択のオプティマイザ整合(optimizer-induced)というアイデアは、AdamW・Muon以外の今後登場しうるオプティマイザ(例: 分散環境向けの新しい適応的手法)に対しても同様に前処理子を閉形式で導出できるか。
- 静的フィルタと動的選択を組み合わせる際の望ましい設計(どちらを先に適用するか、両者のスコアをどう統合するか)は確立されていない。
- データ選択の効率化(スコアリングオーバーヘッド削減)が、より大規模なモデル(数十B〜数百Bパラメータ)でも同程度の追加コスト(数%程度)に収まるかは、GPT-2規模・8B規模の実験だけでは未検証。
## 未編纂の観察
- **静的選択と動的選択は異なる限界を持つ**: 静的選択(FineWeb-Eduクラス分類器・DCLM品質分類器・QuRating・DSIR・UltraFineweb等)はスケーラブルだがモデルの学習状態に対して非適応であり、動的選択(GREATS・MATES・Group-MATES・High-PPL等)は適応的だが従来は生の勾配空間(SGD的ジオメトリ)でスコアリングしており、AdamWやMuonのような現代的オプティマイザが誘導する実際の更新方向とは整合しない(Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]])。
- **オプティマイザのジオメトリを選択スコアに組み込むと効果が上がる**: オプティマイザ誘導の前処理子(AdamWでは対角スケーリング、Muonでは密なNewton–Schulz直交化の線形化)を効用スコアに組み込んだOPUSは、GPT-2 Large/XLのFineWeb 30B学習で静的フィルタ・従来の動的選択(GREATS等)を上回り、60Bトークンのランダム学習にも匹敵・凌駕する(Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]])。
- **動的選択のオーバーヘッドは軽量な推定手法で実用域に収められる**: ナイーブな逐次スコアリングは3.5倍超の速度低下を招くが、Ghost技術(サンプルごとの勾配を明示的に構成しない rank-1 分解)とCountSketch低次元射影を組み合わせることで、追加オーバーヘッドを4.7%まで削減できる(Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]])。
- **決定的なgreedy top-k選択は多様性崩壊を招きうる**: 効用スコアが高い候補を機械的に選び続けると、一時的なproxyノイズや高損失サンプルの狭い部分集合に過集中しやすい。Boltzmannソフトサンプリングのような確率的選択は、この崩壊を緩和し性能を改善する(OPUSのアブレーションでgreedy top-k比+1.26ポイント)(Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]])。
- **proxy(検証方向の推定元)の構築品質が選択性能を左右する**: 素のランダムhold-outをproxyに使うより、ベンチマーク検証集合に類似度検索で整合させた分布内proxy(BENCH-PROXY)を使う方が、ベンチマーク下流性能への整合度が上がり、かつ事前学習コーパスの分布内にとどまるため勾配ノイズが小さい(OPUSのアブレーションで標準proxy比+0.72ポイント)(Source: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]])。
## 関連
- ソース: [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]]
- ソース: [[@2022__arXiv__Will we run out of data? Limits of LLM scaling based on human-generated data]]
- 概念: [[データ枯渇]] / [[データキュレーション]]
- エンティティ: [[FineWeb]]
## 出典
-