# DeepSeek-V3 [[DeepSeek-AI]] が開発した 671B 総パラメータ(トークンあたり 37B 活性化)の [[Mixture-of-Experts]] 大規模言語モデル。 ## アーキテクチャ - **基盤**: Transformer(61 層、隠れ次元 7168) - **アテンション**: [[Multi-head Latent Attention]](128 ヘッド、$d_h = 128$、KV 圧縮 $d_c = 512$) - **FFN**: DeepSeekMoE(共有エキスパート 1、ルーティングエキスパート 256、トークンあたり 8 活性化) - **ゲーティング**: シグモイド関数 + 正規化、補助損失なし負荷分散 - **訓練目的関数**: 次トークン予測 + マルチトークン予測($D = 1$) - **精度**: FP8 混合精度訓練 ## 訓練 - **データ**: 14.8 兆トークン(英語・中国語主体、多言語) - **インフラ**: 2,048 台 NVIDIA H800 GPU、HAI-LLM フレームワーク - **並列化**: PP16 + EP64 + ZeRO-1 DP、[[DualPipe]] - **コスト**: 2,788K GPU 時間(約 557 万ドル) - **コンテキスト長**: 4K→32K→128K(YaRN による 2 段階拡張) ## 性能 オープンソースモデル最高性能を達成し、GPT-4o・Claude-3.5-Sonnet に匹敵する: - MMLU 88.5、MATH-500 90.2、AIME 2024 39.2 - Arena-Hard 85.5(オープンソース初の 85% 超え) - Codeforces 51.6 パーセンタイル ## 輸出規制下のH800制約と mechanical sympathy(Ch.1 の分析) Chris Fregly, *AI Systems Performance Engineering* 第1章は、DeepSeek-V3の学習を[[Mechanical Sympathy|mechanical sympathy]](ハードウェア・ソフトウェア協調設計)の代表事例として分析している。米国の輸出規制によりNVIDIA Blackwell(B200/B300)やHopper(H100/H200)への直接アクセスができず、輸出規制対応版のNVIDIA H800(NVLink帯域約400GB/s、H100の約900GB/sに対し大幅に低い)に限定された環境で、DeepSeekはDualPipeパイプライン並列と、NCCLのデフォルト集団通信を迂回する独自CUDAカーネルを組み合わせることで計算と通信をオーバーラップさせ、帯域制約を隠蔽した。総パラメータ約680B・トークンあたり活性約37B(共有エキスパート1+ルーティングエキスパート8/256、計9エキスパート/トークン)というMoE構成により、限られた計算資源でもフロンティア級の性能を達成したとされる。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]]) R1・R1-Zeroについては、R1がコールドスタートデータ+SFT+棄却サンプリング+RLの段階的パイプラインを踏襲する一方、R1-ZeroはSFTを最小化しRL+chain-of-thoughtデータを重視する新しい訓練アプローチを取り、人手ラベル付きデータへの依存を減らしてコストを削減したと紹介されている(詳細は[[DeepSeek-R1]]・[[DeepSeek-R1-Zero]]を参照)。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]]) ## 推論での再現実装 [[LMSYS]] の [[SGLang]] チームは 2025-05-05、96 台の H100 GPU 上で DeepSeek-V3 級モデルを [[Prefill-Decode分離|PD Disaggregation]] + 大規模 Expert Parallelism により配備し、DeepSeek 公式プロフィールにほぼ匹敵する性能(TP16 基準比 Prefill 最大 3.3 倍・Decode 最大 5.2 倍)を、オープンソース実装として初めて達成したと報告した。(Source: [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]]) ## AIOps 応用(オンプレミス LLM としての採用例) [[@2026__FSE Companion__Leveraging LLMs for Alert Summarization and Mitigation Plan Generation]] は DeepSeek-V3 を IBM Watsonx.ai 上でファインチューニングし、LLaMA-3-70B と並ぶオンプレミス基盤モデルとして [[GPT-4o]] と比較評価した。適応的インコンテキスト学習下で、DeepSeek-V3 は RCA 整合性(MSDS で Precision Alignment 77.42%・Token Alignment 95.16%)と読みやすさ(Readability)で GPT-4o を上回る一方、正確性(Correctness、特に複雑な緩和計画生成)では GPT-4o に劣った。Plan-to-Code(Ansible playbook 生成)のゼロショット評価でも用いられ、Task Completion Rate は MicroSS 71.9%・MSDS 18%であった。(Source: [[@2026__FSE Companion__Leveraging LLMs for Alert Summarization and Mitigation Plan Generation]]) ## 出典 - [[@2024__arXiv__DeepSeek-V3 Technical Report]] - [[@2025__LMSYS Blog__Deploying DeepSeek with PD Disaggregation and Large-Scale Expert Parallelism on 96 H100 GPUs]] - [[@2026__FSE Companion__Leveraging LLMs for Alert Summarization and Mitigation Plan Generation]] - [[@2025__OReilly__AI Systems Performance Engineering - Chapter 1 Introduction and AI System Overview]]