# A Survey of LLM × DATA
## 概要
Xuanhe Zhou ほか(Tsinghua University / Shanghai Jiao Tong University / Alibaba Group / Shanghai AI Laboratory)による arXiv プレプリント(cs.DB)。**LLM とデータ管理の関係を双方向で捉える**点が構成の核であり、**DATA4LLM**(データ管理が LLM を支える方向)と **LLM4DATA**(LLM がデータ管理を強化する方向)を対称に配置する。独自の貢献として、データセット品質を **IaaS**(Inclusiveness・Abundance・Articulation・Sanitization)の 4 次元で評価する原理的レンズを提案する。
> [!abstract] 概要(abstract の日本語訳)
> 大規模言語モデル(LLM)とデータ管理(DATA)の統合は、両分野を急速に再定義しつつある。本サーベイでは双方向の関係を包括的にレビューする。一方では DATA4LLM として、大規模データの処理・保存・提供が事前学習・後訓練・RAG・エージェントワークフローの各段階で LLM に多様性・高品質・サニタイズされたデータ(「IaaS」概念に沿う)を供給する仕組みを扱う。(i) LLM 向けデータ処理はスケーラブルな取得・重複排除・フィルタリング・選択・ドメイン混合・合成データ拡張を含む。(ii) LLM 向けデータ保存は効率的なデータ・モデル形式、分散・異種ストレージ階層、KV キャッシュ管理、耐障害チェックポイントに焦点を当てる。(iii) LLM 向けデータ提供は RAG における知識後処理、LLM 推論におけるプロンプト圧縮やデータ来歴、訓練戦略におけるデータパッキングやシャッフリングの課題に取り組む。他方では LLM4DATA として、LLM が汎用エンジンとしてデータ管理に活用されつつある最近の進展をレビューする。(i) データ操作(自動データクリーニング・統合・発見)、(ii) データ分析(構造化・半構造化・非構造化データに対する推論)、(iii) システム最適化(構成チューニング・クエリ書き換え・異常診断)を、検索拡張プロンプト・タスク特化ファインチューニング・マルチエージェント協調などの LLM 技術で実現する手法を対象とする。
## 書誌情報
- 著者: Xuanhe Zhou, Junxuan He, Wei Zhou, Haodong Chen, Zirui Tang, Haoyu Zhao, Xin Tong, Guoliang Li, Youmin Chen, Jun Zhou, Zhaojun Sun, Binyuan Hui, Shuo Wang, Conghui He, Zhiyuan Liu, Jingren Zhou, Fan Wu(¶ Co-first)
- 所属: [[Tsinghua University]] / [[Shanghai Jiao Tong University]] / [[Alibaba Group]] / [[Shanghai AI Laboratory]]
- 媒体: arXiv プレプリント(cs.DB)、arXiv:2505.18458
- 投稿: 2025-05-24(v3: 2025-06-01)
- URL: https://arxiv.org/abs/2505.18458
- コード: https://github.com/weAIDB/awesome-data-llm
- 構成: 全 12 章(58 PDF ページ)。400 超の論文が対象
- 原本: `.raw/theses/arxiv-2505.18458/`
## 構成と主要テーマ
全 12 章は、導入と品質枠組み(第 1〜2.0 章)・**DATA4LLM**(第 2.1〜2.5 章)・**LLM4DATA**(第 3.1〜3.3 章)・展望(第 4〜5 章)の 4 部に分かれ、**2 つの方向が対称に配置される**。
- **第 1〜2.0 章(枠組み)**: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 1 INTRODUCTION]] が双方向の構図と、先行サーベイ(重複排除・データ選択・アノテーション・古典的機械学習をそれぞれ扱う 4 件)に対する差分を述べる。[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.0 Data Management for LLM (DATA4LLM) - Overview]] が独自の貢献である **IaaS の 4 次元**(inclusiveness 包括性・abundance 充足性・articulation 明瞭性・sanitization 無害化)を定義し、事前学習・継続事前学習・SFT・強化学習・RAG・エージェント・評価という **7 段階ごとにデータ特性が異なる**ことを Table 1 で比較する。
- **第 2.1〜2.5 章(DATA4LLM)**: データ処理を 3 章に分けて扱う。[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.1 Data Processing - Acquisition, Deduplication, and Filtering]] が獲得・重複排除(4 系統)・フィルタリング(2 軸)、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.2 Data Processing - Selection and Mixing]] がデータ選択(3 系統)とデータ混合(訓練前/訓練中 × 4 系統)、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.3 Data Processing - Distillation, Synthesis, and Pipelines]] が合成・蒸留と RefinedWeb / DCLM-Baseline / FineWeb の 3 パイプライン比較を担う。[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.4 Data Storage for LLM]] は形式・分散配置・組織化・移動・耐障害・KV キャッシュの 6 分野、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 2.5 Data Serving for LLM]] はシャッフリング・圧縮・パッキング・来歴の 4 分野を扱う。
- **第 3.1〜3.3 章(LLM4DATA)**: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.1 LLM for Data Manipulation]] がクリーニング・統合・発見、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.2 LLM for Data Analysis]] が構造化・半構造化・非構造化の 3 データ型、[[@2025__arXiv__A Survey of LLM × DATA - Chapter 3.3 LLM for Data System Optimization]] が構成チューニング・クエリ最適化・異常診断を扱う。
- **第 4〜5 章(展望)**: [[@2025__arXiv__A Survey of LLM × DATA - Chapter 4 Challenges and Future Directions]] が DATA4LLM 側 5 項目・LLM4DATA 側 4 項目の課題を「限界 → 具体例 → 有望な方向性」の型で挙げる。[[@2025__arXiv__A Survey of LLM × DATA - Chapter 5 Conclusion]] は 1 段落の総括にとどまる。
## 位置づけと影響
- **IaaS の 4 次元がデータ品質の評価軸として独立して機能する**。とくに abundance 次元は第 2.2 章のデータ混合手法群と**同一の引用文献群を共有**しており、次元の定義と技術が原文中で直結している。[[データ品質SLO]] には、この articulation / sanitization が SRE 文脈の妥当性属性と**独立に到達した並行概念**である点を記録した。
- **LLM4DATA 側の 3 タスクが同じ手法系統を共有する**。構成チューニングとクエリ最適化はいずれも「プロンプトエンジニアリング → RAG による経験強化 → ファインチューニングによる目標整合」の 3 系統で整理され、**異常診断だけがマルチエージェント協調とローカライズド蒸留の 2 系統を追加**して 4 系統になる。診断タスクが他の 2 つより手法的に厚いという構図が読める([[データベース自律診断]] に記録)。
- **段階別 Table 1 の空白がそのまま研究の偏りを示す**。多くのセルが N/A であり、データ処理・保存・提供の技術がライフサイクルのどの段階に集中しているかが一覧できる。
- **ストレージ側は本 vault の既存ノートと強く接続する**。3FS の CRAQ チェーンレプリケーションとページキャッシュ完全無効化の設計を [[分散ファイルシステムとオブジェクトストア]] に、Bamboo / Oobleck / ReCycle の冗長計算 3 系統を [[チェックポイント]] に、KV シュリンキング・配置・インデキシングの 3 方向を [[KVキャッシュ管理]] に記録した。
- **データ混合がスケーリング則の第 3 軸を立てている**。D-CPT・CMR・BiMix が Chinchilla 型の冪乗則を**ドメイン混合比率という第 3 の変数へ拡張**している点を [[LLMスケーリング則]] に記録した。
- **限界と原本内の不一致**: 第 5 章の結論は課題を「DATA4LLM・LLM4DATA・hybrid data and LLM optimization」の 3 観点で提示したと述べるが、**第 4 章本文は §4.1 / §4.2 の 2 節構成のみで hybrid に対応する独立節が存在しない**。推測で補完せず、両章に事実として記録した。
> [!note] 原本の節番号に誤植の疑い
> 第 2.3 章の範囲で `chapters/ch-23.txt` の節番号が "2.2.7.1"〜"2.2.7.3" と印字されているが、内容は §2.3.7(End-to-End Data Processing Pipelines)である。担当が推測で書き換えず、ページ本文に注記したうえで出典は PDF ページ番号で代替した。
## 関連
- 概念: [[LLM分散学習]] / [[データベース自律診断]] / [[根本原因分析]] / [[異常検知]]
## 出典
- Xuanhe Zhou et al., "A Survey of LLM × DATA", arXiv:2505.18458, 2025.