# Qwen3 Alibaba の Qwen チームが 2025 年に公開したオープンウェイト LLM シリーズ。Dense 7 モデル(0.6B・1.7B・4B・8B・14B・32B)と MoE 2 モデル(30B-A3B・235B-A22B)を提供。 ## Dense モデルの特徴 - **深い設計**: Llama 3 と比べ層数が多く(深い)、アテンションヘッド数が少ない(狭い)。 - **QK-Norm**: アテンション内部の Q/K に RMSNorm を適用。 - **GQA**: 全サイズで Grouped-Query Attention を採用。 - 0.6B モデルは現世代で最小クラスのオープンウェイトモデルの一つ。 ## MoE モデルの特徴 - 235B-A22B は DeepSeek V3 と非常に類似するアーキテクチャ。 - **共有エキスパートを廃止**: 以前の Qwen2.5-MoE では採用していたが Qwen3 で廃止。開発者(Junyang Lin)曰く「有意な改善が見られず、推論最適化への懸念もあった」。この決定は DeepSeek V3(共有エキスパートあり)との対比として注目される。 - エキスパートあたりのサイズは DeepSeek V3 より大きく、数は少ない傾向。 ## Qwen3-Next との関係 [[Qwen3-Next]](2025-09 公開)は Qwen3 アーキテクチャを Gated DeltaNet ハイブリッドと MTP で刷新。廃止していた共有エキスパートも再導入した。 ## KVキャッシュのcross-model転送実験 Qwen3の8B・14Bを32Bへの転送元(source)、32Bを転送先(target)としたcross-model KVキャッシュ転送実験([[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]])で、全サイズがKVヘッド数8・ヘッド次元128で一致するmatched-KVファミリの一つとして使われた。14B→32Bは評価6ペア中最も転送品質が高く(5ベンチマーク平均retention 97.6%)、単一ソース層でもRoPE除去後keysの分散の56%を説明する強い線形構造を示した。(Source: [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]]) [[StriaTrace]] の評価では Qwen3-Coder-30B-Instruct-FP8 を Prefill/Decode 分離・TP=8 構成で使い、オンライン推論トレーシングのオーバーヘッドと異常検知を測定した。(Source: [[@2026__OSDI__StriaTrace - Efficient Tracing and Diagnosis for Online LLM Inference]]) ## 関連 - エンティティ: [[Qwen3-Next]] - 概念: [[Mixture-of-Experts]] / [[QK-Norm]] / [[Grouped-Query Attention]] / [[KVキャッシュ管理]] - ソース: [[The-Big-LLM-Architecture-Comparison|The Big LLM Architecture Comparison]] / [[@2026__arXiv__Cross-Model KV Cache Transfer in LLM Families - A Closed-Form Linear Mapping for Prefill Reuse]] / [[@2026__Findings-EACL__Scaling Data-Constrained Language Models with Synthetic Data]] / [[@2026__arXiv__OPUS - Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration]] / [[@2025__arXiv__Step-3 is Large yet Affordable - Model-system Co-design for Cost-effective Decoding]] - ソース: [[@2025__arXiv__Step-3 is Large yet Affordable - Model-system Co-design for Cost-effective Decoding]] — Qwen3 MoE 235B / Qwen3 32B を GQA 系比較対象として理論デコードコストを分析