# NKIBench
[[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] が構築した、[[AWS Trainium]] 向け [[Neuron Kernel Interface (NKI)]] カーネルのベンチマークスイート。実世界の LLM ワークロード(DeepSeek-MoE-16B・Qwen3・Falcon-40B・DeepSeek-V2.5・DeepSeek-V3 671B 由来)から抽出した 14 種のカーネルで構成され、単一演算子(Matmul・BatchMatmul 等)から複合演算子チェーン(LoRA・Group Query Attention・Mamba block 等)まで多様な複雑さを含む。
既存のアクセラレータカーネルベンチマークの多くが相対的な高速化率(ベースラインに対する speedup)のみで評価するのに対し、NKIBench はハードウェアの理論ピーク性能に対する到達率という絶対指標を導入した点が特徴的である。理論ピーク性能はルーフラインモデル(Williams et al., 2009)に基づき、$\max(\text{TrafficMin}/\text{Bandwidth}, \text{FLOPs}_{MM}/\text{Peak}_{MM}, \text{FLOPs}_{Vec}/\text{Peak}_{Vec})$ で算出する。初期カーネルの多くは公式 Neuron コンパイラの出力であり、公式実装が存在しない4問題については著者らが標準的技法(タイリング・融合)で手作業実装した。構造化ストレージと分散プロファイリングサービスを併設し、タスクレベル並列性・サンプルレベル並列性を活かして大量のカーネル候補を効率的にプロファイルする。
## 関連
- [[AWS Trainium]] — 対象ハードウェア
- [[Neuron Kernel Interface (NKI)]] — カーネルの記述言語
- [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] — 初出ソース
## 出典
- [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]](§3)