# Qwen3
Alibaba の Qwen チームが 2025 年に公開したオープンウェイト LLM シリーズ。Dense 7 モデル(0.6B・1.7B・4B・8B・14B・32B)と MoE 2 モデル(30B-A3B・235B-A22B)を提供。
## Dense モデルの特徴
- **深い設計**: Llama 3 と比べ層数が多く(深い)、アテンションヘッド数が少ない(狭い)。
- **QK-Norm**: アテンション内部の Q/K に RMSNorm を適用。
- **GQA**: 全サイズで Grouped-Query Attention を採用。
- 0.6B モデルは現世代で最小クラスのオープンウェイトモデルの一つ。
## MoE モデルの特徴
- 235B-A22B は DeepSeek V3 と非常に類似するアーキテクチャ。
- **共有エキスパートを廃止**: 以前の Qwen2.5-MoE では採用していたが Qwen3 で廃止。開発者(Junyang Lin)曰く「有意な改善が見られず、推論最適化への懸念もあった」。この決定は DeepSeek V3(共有エキスパートあり)との対比として注目される。
- エキスパートあたりのサイズは DeepSeek V3 より大きく、数は少ない傾向。
## Qwen3-Next との関係
[[Qwen3-Next]](2025-09 公開)は Qwen3 アーキテクチャを Gated DeltaNet ハイブリッドと MTP で刷新。廃止していた共有エキスパートも再導入した。
## KVキャッシュのcross-model転送実験
Qwen3の8B・14Bを32Bへの転送元(source)、32Bを転送先(target)としたcross-model KVキャッシュ転送実験([[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]])で、全サイズがKVヘッド数8・ヘッド次元128で一致するmatched-KVファミリの一つとして使われた。14B→32Bは評価6ペア中最も転送品質が高く(5ベンチマーク平均retention 97.6%)、単一ソース層でもRoPE除去後keysの分散の56%を説明する強い線形構造を示した。(Source: [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]])
[[StriaTrace]] の評価では Qwen3-Coder-30B-Instruct-FP8 を Prefill/Decode 分離・TP=8 構成で使い、オンライン推論トレーシングのオーバーヘッドと異常検知を測定した。(Source: [[@2026__OSDI__StriaTrace - Efficient Tracing and Diagnosis for Online LLM Inference]])
## 関連
- エンティティ: [[Qwen3-Next]]
- 概念: [[Mixture-of-Experts]] / [[QK-Norm]] / [[Grouped-Query Attention]] / [[KVキャッシュ管理]]
- ソース: [[The-Big-LLM-Architecture-Comparison|The Big LLM Architecture Comparison]] / [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]] / [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]] / [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]] / [[@2025__arXiv__Step-3 is Large yet Affordable - Model-system Co-design for Cost-effective Decoding]]
- ソース: [[@2025__arXiv__Step-3 is Large yet Affordable - Model-system Co-design for Cost-effective Decoding]] — Qwen3 MoE 235B / Qwen3 32B を GQA 系比較対象として理論デコードコストを分析