# Nanotron
[[HuggingFace]] が公開した LLM 学習フレームワークで、機能提供に最小限のオーバーヘッドしか課さないことを主眼とする。取り込む最適化を主観的に厳選しており、one-forward-one-backward パイプラインエンジンによるテンソル・データ・パイプライン並列化(3D Parallelism)、Expert Parallelism、ZeRO-1 オプティマイザ、FP32 勾配累積、パラメータの結合/シャーディング、ネットワークスケーリング用の Spectral µTransfer パラメトリゼーションを実装する。状態空間モデル(SSM)対応と DoReMi の統合も特徴で、Table 2 の学習対応フレームワーク中で SSM 対応を明記する唯一の例。(Source: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]], Table 2)
## 関連
- ソース: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]]
- 概念: [[並列化戦略]] / [[LLM分散学習]] / [[Mixture-of-Experts]]