# Common Crawl
Common Crawlは、ウェブを継続的にクロールしてアーカイブする公開データ基盤である。[[PLaMo-100B]]では、2017〜2024年の20 dumpから日本語HTML・テキストを抽出し、独自の前処理パイプラインで約460B tokenのコーパスを作成した。(Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]])
## 関連
- 利用モデル: [[PLaMo-100B]]
- 関連データセット: [[RefinedWeb]]
- 出典: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]
- ソース: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]