# データキュレーション Navigation: [[index]] | [[hot]] ## 定義 データキュレーション(data curation)とは、大規模言語モデル(LLM)の事前学習に用いる生コーパスから、ヒューリスティックフィルタリング・重複排除(deduplication)・モデルベースフィルタリング・データ混合(data mixing)などの手法を通じて、下流タスク性能を最大化する訓練セットを選び出す工程を指す(Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]])。データ選択(data selection)や品質フィルタリング(quality filtering)とほぼ同義で使われることも多いが、本ページでは複数の処理段階(抽出・クリーニング・重複排除・フィルタリング・混合)を包含する上位概念として扱う。「[[データ制約スケーリング]]」(データ量そのものの制約下でのスケーリング挙動)や「[[合成データ]]」(不足データの生成による補完)とは異なる軸であり、本概念は「与えられたプール内のどのデータを残す/混ぜるか」という選択・重み付けの問題に焦点を当てる。 ## 未解決の問い - モデルベースフィルタリング(fastText 等の分類器)が人間の直感的な品質判断やヒューリスティックフィルタリングより優れる理由は何か。分類器の正例データの選び方(命令形式データ vs. 伝統的な高品質ソース)がなぜ結果に大きく影響するのか。 - 小規模モデル(400M パラメータ級)でのデータキュレーション手法の優劣が大規模モデル(7B 級)へ転移するという知見は、フィルタリング以外の手法(合成データ生成、動的データ混合など)にも一般化するか。 - 高品質にフィルタリングされたデータセットに対して、追加の高品質ソース混合がむしろ性能を悪化させる現象(DCLM-BASELINE の事例)は、どの程度他のデータセット・スケールでも再現するか。 ## 未編纂の観察 - **モデルベースフィルタリングが高品質コーパス構築の鍵である**: PageRank・SemDedup・BGE 特徴量分類器・AskLLM・パープレキシティフィルタリング・top-k 平均ロジット・fastText の 7 手法を比較した結果、fastText 二値分類器が最良(CORE 30.2 / EXTENDED 15.4)であった。特に、Wikipedia のような伝統的な高品質ソースではなく、命令形式データ(OpenHermes 2.5 + r/ExplainLikeImFive)を正例として使うことで CORE が 3.5 ポイント向上した(Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]])。 - **小規模実験の手法優劣は大規模へ高い順位相関で転移する**: 400M-1x・1B-1x・3B-1x スケールでの 10 手法の性能順位は、7B-1x スケールでの順位と高い相関(Pearson r = 0.838, 0.956, 0.982)を持ち、低コストな小規模実験でのデータキュレーション反復を正当化する(Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]])。 - **高品質にフィルタリングされたデータには追加混合が有害になりうる**: C4・RedPajama-CC・RefinedWeb のような相対的に低性能な Common Crawl サブセットには Wikipedia 等の高品質ソースの混合が有効(CORE +1.4〜+2.2)だが、DCLM-BASELINE のようにモデルベースフィルタリングで既に高品質化されたデータには混合がむしろ性能を悪化させた(CORE −1.2)(Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]])。 - **テキスト抽出方式の選択がフィルタリング以前の段階で性能を左右する**: Common Crawl 提供の WET ファイル(事前抽出済みテキスト)ではなく resiliparse や trafilatura で HTML から再抽出するだけで CORE が 2.5 ポイント以上改善し、C4・RedPajama・Dolma-V1 のような WET ファイル依存の既存データセットの性能劣位を部分的に説明する(Source: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]])。 ## 関連 - [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]] - [[DataComp-LM (DCLM)]] - [[Common Crawl]] - [[スケーリング則]] - 概念: [[事前学習データ選択]] ## 出典 - [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]