# Neuron Kernel Interface (NKI) AWS が提供する [[AWS Trainium]] 向けの Python 埋め込みカーネル言語(2026年時点で beta 2.20)。カーネル開発者はテンソルの最初の次元(パーティション次元)と残りの自由次元 F を区別してプログラムする。 主要な API 制約と構文規則([[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] Appendix A.3 のプロンプトより): - PSUM の自由次元サイズはアーキテクチャ上限 512 を超えられず、SBUF の各パーティションは 192KB を超えられない - タイルのパーティション数はアーキテクチャ上限 128 を超えられない - `nki.isa.nc_matmul(stationary, moving, ...)` はテンソルエンジンで `transpose(stationary) @ moving` を計算する。128×128 の stationary と 128×512 の moving で最適スループットを達成できる - `affine_range` によるループ反復間の並列実行では、各反復が異なるメモリ位置に書き込む必要がある(出力依存の制約)。同一位置への書き込みには `sequential_range` を用いる - 制御ブロック(if/else/for)内で定義したテンソルはスコープ外で参照できない NKI は比較的新しいプログラミングモデルであり、GPU の CUTLASS のような成熟した最適化レシピ集が確立されていない。この状況が [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] の中心的な問題設定(専門家提供の最適化知識に頼らない自律的カーネル最適化)の動機となっている。 ## 関連 - [[AWS Trainium]] — NKI がターゲットとするハードウェア - [[Amazon Web Services]] — 提供元 - [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] — 初出ソース ## 出典 - [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]]