# Predibase 強化学習を用いて自動GPUプログラミングを実証したスタートアップ。LLMを訓練してOpenAI Tritonの高度なプログラマーにできるかを検証し、PyTorchコードをPyTorchのTorchInductorコンパイラより高速に置き換えるTritonコードを生成させることを目指した。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 20 AI-Assisted Performance Optimizations and Scaling Toward Multimillion GPU Clusters]]) 実験ではH100 GPUクラスタを用い、GRPO(Group Relative Preference Optimization)と呼ばれる強化学習ベースのファインチューニング手法を、320億パラメータのQwen2.5-Coder-32B-Instructモデルに適用した。訓練済みモデルは13タスク全てで正しいTritonカーネルを生成できた。ただし、この訓練環境は正しさの達成を目的として最適化されており、実行速度そのものを最適化目的とはしていなかった。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 20 AI-Assisted Performance Optimizations and Scaling Toward Multimillion GPU Clusters]]) 生成されたカーネルの正しさ・速度をコンパイル・テストし、エラーなく正しい結果を出し、かつベースラインより速く動作した場合に正の報酬を与える報酬関数を設計した。5,000訓練ステップ後には、ほぼ0%だった成功率が約40%まで向上し、一部のTritonカーネルはベースライン比最大3倍高速化した。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 20 AI-Assisted Performance Optimizations and Scaling Toward Multimillion GPU Clusters]]) ## 関連 - [[wiki/entities/AI Systems Performance Engineering|AI Systems Performance Engineering]] — Chapter 20 で言及 - [[OpenAI Triton]] — 生成対象のGPUプログラミング言語 - [[LLM駆動GPUカーネル生成]] — 同種の「LLMによるカーネル自動生成」を扱う概念 - [[@2025__OReilly__AI Systems Performance Engineering - Chapter 20 AI-Assisted Performance Optimizations and Scaling Toward Multimillion GPU Clusters]] — 出典source