# Step-3
[[StepFun]] が開発した 321B 総パラメータ(LLM 部分 316B、活性化 38B/トークン、視覚エンコーダ 5B)の VLM。Transformer(61 層、隠れ次元 7168)を基盤とし、アテンション機構に低ランク行列分解を用いる Multi-Matrix Factorization Attention(MFA)、FFN に DeepSeekMoE 風の共有エキスパート付き MoE(先頭4層・最終層を除く全層に適用)を採用する。デコードコストの最小化を最優先目標とし、Attention-FFN Disaggregation(AFD)という attention/FFN を別ハードウェア集合に分離するシステムとの協調設計で、DeepSeek-V3・Qwen3 MoE 235B を上回る活性化パラメータ数(38B)を持ちながらそれらより低い理論デコードコストを達成する。Hopper GPU 上、50ms TPOT SLA 下で最大 4,039 tokens/GPU/s のデコードスループットを達成し、同条件の DeepSeek-V3(2,324 TGS)を約 74% 上回る。(Source: [[@2025__arXiv__Step-3 is Large yet Affordable - Model-system Co-design for Cost-effective Decoding]])
## 関連
- エンティティ: [[StepFun]](開発元) / [[StepMesh]](AFD 通信ライブラリ) / [[DeepSeek-V3]] / [[Qwen3]] / [[Kimi K2]](比較対象モデル)
- 概念: [[Mixture-of-Experts]] / [[Rooflineモデル]] / [[メモリウォール]]
- ソース: [[@2025__arXiv__Step-3 is Large yet Affordable - Model-system Co-design for Cost-effective Decoding]]