# Switch Transformer-C
Switch Transformer論文で報告された約1.6TパラメータのMoEモデル。1T級DNNとして大きな公開事例だが、記事執筆時点ではTransformer構造が現在の主流と異なり、H100上で効率よく実行できるか不明と説明される。
Switch Transformer系は小さなRouterでトークンをエキスパートへ割り当てる学習型ルーティングを使う。[[Preferred Elements]]の1T級検証では、この系譜に近い構成でRouterが特定エキスパートへ崩壊したため、[[Hash Layers]]へ移行した。
## 関連
- 概念: [[Mixture-of-Experts]] / [[負荷分散]] / [[条件付き計算]]
- 比較対象: [[PLaMo-100B]] / [[Hash Layers]]
## 出典
- [[@2024__Preferred Networks__1兆 (1T) パラメータ規模のLLMの事前学習検証]]
- [Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity](https://arxiv.org/abs/2101.03961)