# RefinedWeb
RefinedWebは、ウェブ由来の大規模言語モデル事前学習データセットである。[[PLaMo-100B]]では、英語データの主要な構成要素として前半1.5T tokenの42%、後半0.5T tokenの17%を使用した。また、日本語データの処理パイプライン設計の参照先の一つとなった。(Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]])
## 関連
- 利用モデル: [[PLaMo-100B]]
- 関連基盤: [[Common Crawl]]
- 出典: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]