# GuideLLM Neural Magic(vllm-project)が開発するオープンソースの LLM 推論ベンチマークフレームワーク。OpenAI 互換の Kubernetes ホスト推論エンドポイントに対して実運用相当のワークロードをシミュレートし、性能・リソース要件・コスト影響を評価する。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]]) - Kubernetes GenAI 推論性能評価の産業論文では、Whisper で転写された文書をカスタムデータセットとしてプロンプト生成に用い、複数の同時実行度(synchronous streams)でリクエストを送信して TTFT(Time to First Token)・ITL(Inter-Token Latency)を計測した。Gateway API Inference Extension(GAIE)の Random Scheduling vs Precise Scheduling 比較実験では、32 件の転写文(各平均 8,500 トークン)を 8 回ずつ繰り返した 256 件のリクエストを生成した。(Source: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]]) ## 関連 - 本ソース: [[@2026__ICPE__Evaluating Kubernetes Performance for GenAI Inference]] - 関連システム: [[vLLM]] / [[Gateway API Inference Extension]] / [[llm-d]]