# llm-jp corpus filter
llm-jp corpus filterは、[[PLaMo-100B]]の日本語データセット構築で全文書のフィルタリングに使われたツールである。記事は実装の詳細やフィルタ基準を説明していないため、ここでは採用事実のみを記録する。(Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]])
## 関連
- 利用モデル: [[PLaMo-100B]]
- 入力基盤: [[Common Crawl]]
- 出典: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]