# A Survey of LLM × DATA - Chapter 1: INTRODUCTION
> 次: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] | 全体: [[A Survey of LLM × DATA]]
## 要約
本章は、LLM とデータ管理(DATA)の双方向の関係を扱うサーベイの導入である。一方向は **DATA4LLM**(LLM のためのデータ管理: データ処理・データストレージ・データサービング)、もう一方向は **LLM4DATA**(データ管理のための LLM: データ操作・データ分析・システム最適化)であり、本サーベイはこの両方向を包括的にレビューする(§1)。
**Figure 1: LLM × DATA の全体像(IaaS 概念を含む)**
![[_attachments/arxiv-2505.18458/ch01-fig1-overview-llm-data-iaas-concept.png]]
(Fig. 1. DATA4LLM(データ処理・ストレージ・サービング、代表プロダクト: High-Flyer・Databricks・Snowflake・Data Juicer・Dataverse・Trafilatura・3FS・LanceDB・vLLM・Haystack・Langchain・LlamaIndex 等)と LLM4DATA(データ操作・分析・システム最適化)を、中央の IaaS 概念(inclusiveness・abundance・articulation・sanitization)と、origin data → training data → model data → RAG data → inference data という LLM ライフサイクル軸で結びつけた全体図。右端に事前学習からエージェントまでの段階別代表データセット例を示す。)
DATA4LLM の具体例として、Qwen2.5-VL の事前学習で用いられた約 4TB のマルチモーダルトークンを処理する際の課題(1 万カテゴリ超の視覚的接地データの獲得(§2.3.1)、堅牢なデータフィルタリング(§2.3.3)、事前学習段階のパイプライン調整(§2.3.7))、DeepSeek-R1(6,710 億パラメータ)級のモデルデータを扱うストレージの課題(複数ストレージノードへの分散配置と一貫性管理(§2.4.2)、計算ノードへの高スループット I/O(§2.4.4)、学習中断からの復旧のための障害耐性機構(§2.4.5))、RAG における検索データの提供課題(EyeLevel.ai の観測では、ベクトル類似度のみに依拠した場合 10,000 ページ文書で精度が顕著に低下し、100,000 ページでは劣化が最大 12% に達する(§2.5.1 のノイズ除去・再ランキング、§2.5.2 の圧縮))が示される(§1)。
LLM4DATA の具体例として、LLM によるデータクリーニング(日付表記や表記揺れのような不整合を、明示的なルール定義なしに意味的類似性から解決する、§3.1)、構造化・半構造化・非構造化データを横断する統一的な分析(医療記録や取引データのような異種データソースに対する、タスク横断的な意味理解に基づく分析、§3.2)、システム最適化(手動チューニングや従来の深層学習ベース手法では TPC-H ワークロード 1 件の設定探索に 20 時間規模のリプレイを要する例を挙げ、検索拡張プロンプトによる根本原因の特定や設定推奨、§3.3)が示される(§1)。
**Figure 2: LLM ライフサイクル各段階のデータ特性の実例**
![[_attachments/arxiv-2505.18458/ch01-fig2-example-data-characteristics-llm-stages.png]]
(Fig. 2. (a) 事前学習データ(RedPajama の 7 ドメイン比率、1.2T トークン超の OBELICS 等)、(b) 継続事前学習データ(医療画像データ)、(c) SFT データ(Closed QA・Open QA・Captioning の prompt-response 例)、(d) 強化学習データ(RLHF の outcome supervision と process supervision、RoRL の `<think>`/`<answer>` タグと GRPO)、(e) RAG データ(医療診断レポートの instruction 形式)、(f) エージェントデータ(instruction・action・observation からなる相互作用軌跡)の 6 種の実例を並置し、段階ごとにデータの形式・粒度が大きく異なることを示す。各段階の詳細な特性比較は [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] §2.2 で扱う。)
§1.1・§1.2 は、後続の章(§2・§3)で扱う技術群の概観を先出しする。§1.3 は既存サーベイとの比較を通じて、本サーベイ独自の 3 つの貢献を主張する。
## 分類軸(taxonomy)
本章は、本サーベイ全体を貫く 2 方向の分類軸を提示する(下位の分類・IaaS の 4 次元の詳細定義は [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] を参照)。
**DATA4LLM(§1.1)** — LLM のライフサイクル全体(事前学習・継続事前学習・ファインチューニング・強化学習・RAG・エージェント・評価の 7 段階)にわたるデータ管理技術:
- **データ処理**(§2.3): データ獲得・重複排除・フィルタリング・選択・ミキシング・合成
- **データストレージ**(§2.4): データフォーマット・LLM データ配置(分散・異種ストレージ)・LLM データ組織化(RAG 用)・LLM データ移動・モデルデータ障害耐性・KV キャッシュ
- **データサービング**(§2.5): データシャッフリング・データ圧縮・学習データパッキング・推論データ来歴
**LLM4DATA(§1.2)** — LLM を用いてデータ管理タスク自体を高度化する技術:
- **データ操作**(§3.1): データクリーニング(標準化・エラー処理・欠損補完)・データ統合(エンティティマッチング・スキーママッチング)・データ発見(プロファイリング・アノテーション)
- **データ分析**(§3.2): 構造化データ分析(NL2SQL・NL2GQL)・半構造化データ分析・非構造化データ分析(文書分析・プログラム分析)
- **システム最適化**(§3.3): 設定チューニング・クエリ最適化・異常診断
## 代表手法・システムの比較
### 既存サーベイとの比較(§1.3)
本サーベイは既存の LLM × データ管理サーベイ([405], [55], [86], [398], [272], [274], [374], [488] として引用)と対比して、3 点の独自性を主張する。
1. **IaaS 概念の提案**: LLM データセットの品質を評価する原理的な視点として、inclusiveness(包括性)・abundance(充足性)・articulation(明瞭性)・sanitization(無害化)の 4 次元からなる IaaS 概念を提案する(詳細定義は §2.1、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] に転記)。
2. **LLM ライフサイクル全体を横断するデータ特性の調査**: 事前学習段階のみに焦点を当てる既存サーベイ([405], [55], [86])と異なり、SFT・RAG・エージェントベースのアプリケーションを含む LLM ライフサイクル全体にわたるデータ特性の違いを調査し、データ処理・ストレージ・サービング技術の体系比較(Table 1)を提供する。比較対象として、[405] は重複排除とフィルタリングに、[55] はデータ選択に、[373] はデータアノテーション戦略に、それぞれ焦点を絞っており、データ管理パイプライン全体を横断する体系的な視点を提供していないと位置づける。
3. **LLM4DATA の新規性**: 既存研究 [488] は古典的な機械学習のデータ管理への応用を調査済みだが、LLM 固有の強み・限界(特に非 LLM タスクのためのデータ操作、半構造化・非構造化データの処理、システムレベル最適化の実現)を扱っていないとし、この空白を LLM4DATA として埋めると主張する。
## 傾向と未解決課題
§1.3 末尾は、本サーベイが今後の方向性として両方向から課題を挙げる。
- **DATA4LLM 側**: 実務上の LLM 学習・展開ニーズを満たすためのデータ管理技術の改善(例: 効率的なデータ評価、スケーラブルなマルチモーダルストレージ)。
- **LLM4DATA 側**: 多様な実世界シナリオで複雑なデータ管理タスクを遂行するための LLM の能力強化(例: プライベートな知識の理解、非系列・非テキストデータの情報量の多い表現)。
(詳細な章別の課題・今後の方向性は [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]] を参照。)
## 関連
- 全体: [[A Survey of LLM × DATA]]
- 次章: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]](IaaS 概念の 4 次元の詳細定義、LLM ライフサイクル 7 段階のデータ特性、Table 1)
- DATA4LLM 各論: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.4 Data Storage for LLM]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.5 Data Serving for LLM]]
- LLM4DATA 各論: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.1 LLM for Data Manipulation]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.2 LLM for Data Analysis]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.3 LLM for Data System Optimization]]
- 総括: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]] / [[@2025__arXiv__A Survey of LLM × DATA - Chapter 5 Conclusion]]
- 概念: [[言語モデル事前学習]]
- 所属機関: [[Shanghai Jiao Tong University]] / [[Tsinghua University]] / [[Alibaba Group]] / [[Shanghai AI Laboratory]]
- 著者: [[Xuanhe Zhou]] / [[Guoliang Li]]
## 出典
- §1(INTRODUCTION 本文): DATA4LLM・LLM4DATA の定義、Example 1-3(データ処理・ストレージ・サービング/データ操作・分析・システム最適化)の具体例
- §1.1(Techniques of DATA4LLM): データ処理・ストレージ・サービングの技術一覧
- §1.2(Techniques of LLM4DATA): データ操作・分析・システム最適化の技術一覧
- §1.3(Comparison with Existing Surveys): 既存サーベイとの差分の 3 主張、今後の方向性
- Fig. 1(`.raw/theses/arxiv-2505.18458/images/p001-Figure1.png`): LLM × DATA の全体像(IaaS 概念含む)
- Fig. 2(`.raw/theses/arxiv-2505.18458/images/p005-Figure2.png`): LLM ライフサイクル各段階のデータ特性の実例
- 著者・所属: 論文冒頭のタイトルページ(`.raw/theses/arxiv-2505.18458/chapters/ch-01.txt` 6-10 行目)
- 本章の原本テキストは PDF p1-5(`.raw/theses/arxiv-2505.18458/chapters/ch-01.txt`)に対応し、文末(§1.3 末尾)まで完結しており、次章ファイルへの食い込みは確認されなかった。