# FP8-LM
FP8-LMは、FP8を大規模言語モデル訓練の計算・メモリ・通信へ適用する手法である。
[[Preferred Elements]]の1Tパラメータ級MoE検証では、FP8-LMを参考にオプティマイザ状態を低精度で保持した。1TパラメータではAdamWの状態だけで約12TBを要するため、低精度化により使用量を約4〜5TBへ削減し、活性化保存などへメモリを振り向けた。
## 関連
- 実証組織: [[Preferred Elements]] / [[Preferred Networks]]
- 概念: [[混合精度訓練]] / [[LLM分散学習]] / [[Mixture-of-Experts]]
## 出典
- [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]]
- [[@2023__arXiv__FP8-LM Training FP8 Large Language Models]]