# Common Crawl Common Crawlは、ウェブを継続的にクロールしてアーカイブする公開データ基盤である。[[PLaMo-100B]]では、2017〜2024年の20 dumpから日本語HTML・テキストを抽出し、独自の前処理パイプラインで約460B tokenのコーパスを作成した。(Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]) ## 関連 - 利用モデル: [[PLaMo-100B]] - 関連データセット: [[RefinedWeb]] - 出典: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]] - ソース: [[@2024__NeurIPS__DataComp-LM - In search of the next generation of training sets for language models]]