# LLMによるカーネル最適化 LLM を用いてアクセラレータカーネル(GPU・TPU・NPU・データフローアクセラレータ向けの低レベル実装)を自動生成・最適化する研究領域。[[GPU最適化]] が人間プログラマが手動適用するコンパイラ非依存の変換・チューニング技術のカタログであるのに対し、本概念は「LLM エージェントが探索・生成・評価のループを自律的に回してカーネルを改善する」という探索駆動のパラダイムを指す点で射程が異なる。 ## 定義 LLM によるカーネル最適化とは、ベースラインカーネルのコード・プロファイリング結果・ハードウェア仕様を入力として LLM(単体または複数エージェントの協調)がカーネルの書き換え案を生成し、実測性能によるフィードバックループを通じて反復的に改善していく手法群である。[[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] はこの領域に、ビームサーチによる候補探索と、過去の最適化経験を蒸留して未来のイテレーションに転写する自己改善型メモリという2機構を組み合わせて取り組んだ。 **[[LLM駆動GPUカーネル生成]] との境界**: 同時期に取り込まれた [[LLM駆動GPUカーネル生成]]([[@2026__arXiv__FlashInfer-Bench - Building the Virtuous Cycle for AI-driven LLM Systems]] 起点)は GPU(Triton/CUDA)カーネルの「生成→検証→本番統合」パイプラインと言語選択のトレードオフに焦点を当てる。本ページ(AccelOpt 起点)は GPU に限らない新興 AI アクセラレータ(Trainium)を対象に、ビームサーチと自己改善メモリという探索アルゴリズム側の設計に焦点を当てる。両者は「LLM がアクセラレータカーネルを自律的に改善する」という共通の上位概念を異なる軸(パイプライン設計 vs 探索アルゴリズム設計、GPU vs 新興アクセラレータ)から扱っており、今後の ingest で統合を検討する余地がある。 AccelOpt が引用する関連システム(§5 Related Work)には、GPU カーネル生成のベンチマーク [[KernelBench]](Ouyang et al., 2025)、手作業の最適化リストに依存する Autocomp(Hong et al., 2025、Trainium 以外のテンソルアクセラレータ向け)、TPU 上の行列積・FlashAttention を対象とし実装非公開の AlphaEvolve(Novikov et al., 2025)、AMD NPU カーネルをプロンプト進化で改善する GEPA(Agrawal et al., 2025)、CUDA 最適化にコントラスト強化学習を用いる CUDA-L1(Li et al., 2025)、Triton カーネル生成の TritonRL(Woo et al., 2025)、テンソルプログラムのマルチレベルスーパー最適化を行う Mirage(Wu et al., 2025、OSDI '25)がある。 ## 横断的知見 - (このページは新規作成のため、複数ソースの突き合わせによる横断的知見はまだ蓄積されていない。今後 KernelBench・Autocomp・AlphaEvolve・GEPA・CUDA-L1・TritonRL・Mirage 等が個別に ingest された際に、AccelOpt との比較知見をここに追記する) ## 未解決の問い - AccelOpt の最適化メモリは、あるカーネル(例: Trainium の BatchMatmul)で蓄積した経験を、構造的に異なるカーネル(例: RoPE のようなメモリバウンドカーネル)へ転用できるか。著者ら自身がこの cross-problem transfer を「今後探索する価値がある」と明記しており未検証(Source: [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] §2.3)。 - Trainium のような新興アクセラレータ(訓練データが乏しい)での AccelOpt の有効性は、GPU のような訓練データが豊富な成熟プラットフォームでどこまで再現・向上するか。AccelOpt は 24 個の Triton カーネル(H100)で 1.27 倍の平均高速化を示したが、体系的な比較は今後の課題(Source: [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] §4.6)。 - 正しさチェッカーを悪用した「偽の高速化」(必要な計算を省略して見かけ上のスピードアップを得る)をランダム入力テストより厳密に検知する等価性検証手法は、LLM カーネル生成システム全般にどう組み込めるか(Source: [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] Appendix A.1)。 - ビームサーチ+メモリと繰り返しサンプリングのコスト効率の差は、対象アクセラレータのプログラミングモデルの成熟度(NKI vs CUDA 等)によってどう変化するか。 ## 関連 - [[GPU最適化]] — 人間主導の手動最適化技術カタログ(対照概念) - [[AIアクセラレータ]] — 対象ハードウェアの横断概念 - [[エージェントメモリ]] — AccelOpt の最適化メモリが属する上位概念 - [[LLM駆動GPUカーネル生成]] — GPU(Triton/CUDA)に特化した生成パイプライン・言語トレードオフの姉妹概念(境界は上記定義節参照) - [[AWS Trainium]] / [[Neuron Kernel Interface (NKI)]] / [[NKIBench]] — AccelOpt が対象とするハードウェア・言語・ベンチマーク ## 出典 - [[@2026__MLSys2026__AccelOpt - A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization]] — Genghan Zhang ほか(Stanford University・Amazon Web Services・University of Toronto)、arXiv:2511.15915、MLSys 2026 Oral