# スパース注意
## 定義
スパース注意(Sparse Attention)とは、各デコードステップで KV キャッシュ全体ではなく top-k 等で選ばれた一部分のみに注意を向けることで、通常の自己注意が持つ二次の計算・I/O コスト増大を回避しながらモデリング能力を維持する手法である。DeepSeek Sparse Attention(DSA)はその代表例であり、[[DeepSeek-V3.2]] や GLM-5.1 系列に採用されている。(Source: [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]])
## 横断的知見
- **スパース注意は計算量を削減しても、メモリ容量ボトルネックを解消しない**: top-k 選択によりあるデコードステップで active な KV エントリはごく一部でも、高速アクセスのためフルコンテキスト分の KV キャッシュを GPU HBM 上に保持し続ける必要がある。このため、スパース注意を採用したサービングシステムはしばしば compute-bound ではなく **capacity-bound** になり、達成可能なバッチサイズとスループットの上限がメモリ容量で決まる。HiSparse はこの capacity-bound な特性を、フルコンテキストをホストメモリへ退避し GPU HBM 上に「hot device buffer」だけを残す階層メモリ設計で緩和し、並行数256でベースライン比3倍超、長文脈シナリオで最大5倍のスループット改善を報告した。(Source: [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]])
- **スパース注意向けのキャッシュエビクションは、通常の LRU がそのまま有効に機能する**: [[KVキャッシュ管理]] の横断的知見では、Aliyun 本番トレース(KVCache Cache in the Wild)が「KV ブロック寿命は短命かつ予測可能で LFU は不適切、LRU も最適でない」ことを示していたが、HiSparse の top-k キャッシュミス問題では逆に、hot device buffer サイズの拡大(2048→4096)と LRU 退避方針の組み合わせが FIFO・Random より一貫してミスカウントを削減した。両者の対象(リクエスト間でのブロック再利用 vs 単一デコード内での top-k アクセスパターン)が異なるため、どのポリシーが有効かはキャッシュされる対象の時間粒度に依存する可能性がある。(Source: [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]])
## 未解決の問い
- HiSparse は DeepSeek Sparse Attention(DSA)を用いるモデルファミリ(DeepSeek-V3.2、GLM-5.1)にのみ対応する実験的機能であり、他のスパース注意方式(例: StreamingLLM、SnapKV 等のトークン破棄系)や、[[SCBench]] が指摘した sub-O(n) メモリ手法のマルチターン破綻問題との関係は未検証。
- 低並行数で HiSparse がベースラインを下回る(スパース KV ロードの追加 I/O がメモリ節約効果を上回る)条件の閾値は、モデルサイズ・top-k・ホスト-デバイス帯域にどう依存するか。
- ハイブリッドモデル(注意とその他の機構を混在させるアーキテクチャ)への拡張が Future Work として予告されているが、対応方式は未公開。
## 関連
- ソース: [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]]
- エンティティ: [[SGLang]] / [[LMSYS]] / [[DeepSeek-V3.2]]
- 概念: [[KVキャッシュ管理]] / [[メモリ階層とキャッシュ]] / [[注意機構]]
## 出典
- [[@2026__LMSYS Blog__HiSparse - Turbocharging Sparse Attention with Hierarchical Memory]](HiSparse: 階層メモリによるスパース注意の容量ボトルネック緩和、LMSYS Blog 2026-04-10)