# FP8-LM FP8-LMは、FP8を大規模言語モデル訓練の計算・メモリ・通信へ適用する手法である。 [[Preferred Elements]]の1Tパラメータ級MoE検証では、FP8-LMを参考にオプティマイザ状態を低精度で保持した。1TパラメータではAdamWの状態だけで約12TBを要するため、低精度化により使用量を約4〜5TBへ削減し、活性化保存などへメモリを振り向けた。 ## 関連 - 実証組織: [[Preferred Elements]] / [[Preferred Networks]] - 概念: [[混合精度訓練]] / [[LLM分散学習]] / [[Mixture-of-Experts]] ## 出典 - [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]] - [[@2023__arXiv__FP8-LM Training FP8 Large Language Models]]