# Kimi Delta Attention (KDA) [[Moonshot AI]] が開発した線形アテンション機構。[[Gated DeltaNet]] の改良版で、スカラーゲートをチャネルワイズゲート(各特徴次元に個別の忘却・学習率)に置き換え、長コンテキスト推論の精度改善を狙う。 ## 系譜 - **[[Kimi Linear]](2025-10、48B)**: KDA(3) + [[Multi-Head Latent Attention|MLA]](1) の 3:1 ハイブリッド構成で初出。NoPE(RoPE なし)と組み合わせ、位置情報を KDA ブロックに委ねる設計。Gated DeltaNet-H1 比で同等の生成速度・高いベンチマーク性能、MLA 比で高速な生成速度・同等の精度を達成した。 - **[[Kimi K3]](2026-07、2.78T)**: 技術レポート公開(2026-07-27)により具体的な変更点が確定した。KDA 3層 + Gated MLA 1層の 3:1 ハイブリッド(69 KDA + 24 MLA)。Kimi Linear からの変更は3点: (1) 減衰対数化を非有界 negative-Softplus から**下限付きスケーリング Sigmoid**($g_{min}=-5$)に変更し、対角タイルも Tensor Core の密行列積で計算可能にした(§FlashKDA カーネルの前提)。(2) 出力ゲートを低ランクからフルランクの入力依存射影に変更。(3) アテンション出力を訓練中 FP32 で保持しバイアス丸め誤差を回避。「512-head MLA」というブログ記事の記述は誤読で、正しくは MLA の**ヘッド次元**が 512(§7 のケーススタディでの言及)であり、K3 全体のアテンションヘッド数は 96。vLLM コミュニティへ KDA 対応プレフィックスキャッシュを寄与し、コーディング作業でキャッシュヒット率 90% 以上を達成。 ## 意義 Kimi Linear(48B)は「線形アテンションは本番で精度問題がある」として MiniMax-M2 が撤退した後、チャネルワイズゲーティングで精度問題に対処できると主張した。K3(2.78T)での採用は、この主張が Kimi K2(1T)の 1/20 規模の実証実験を超えて大規模モデルでも成立することを示す検証事例となった。 ## 関連 - エンティティ: [[Moonshot AI]] / [[Kimi Linear]] / [[Kimi K3]] - 概念: [[Gated DeltaNet]] / [[Multi-Head Latent Attention]] / [[線形注意]] - ソース: [[The-Big-LLM-Architecture-Comparison|The Big LLM Architecture Comparison]] / [[@2026__Moonshot AI__Kimi K3 - Open Frontier Intelligence]]