# FineWeb2 [[FineWeb]] の多言語版で、Common Crawl から多言語 Web テキストを抽出するパイプラインを持つコーパス(Penedo et al., 2025)。[[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]] では JA-WEB-9B・JA-WEB-63B(日本語データ)のサンプリング元として利用された。