# TensorRT-LLM
[[NVIDIA]] が開発する LLM 推論最適化ライブラリ。量子化・テンソル並列・Flash Attention といった最適化技術を統合し、NVIDIA GPU 上での推論スループット・レイテンシを最大化する。[[GenAI-Perf]] によるベンチマーク測定の主要ターゲットの一つ。
## 主な機能
- **量子化**: INT8/FP8 量子化による推論高速化とメモリ削減
- **テンソル並列**: 複数 GPU への重みシャーディング
- **Flash Attention**: メモリ効率の高いアテンション実装
- **連続バッチング**(Continuous Batching): スループット最大化のためのリクエストスケジューリング
[[Netflix]]は[[Triton Inference Server]]上の本番LLMサービング基盤を当初TensorRT-LLMで構築していたが、2026年夏、オープンソースエンジンとの性能差縮小とワークロード構成の広がり(埋め込み生成・prefill専用推論・カスタム制約ロジック)を理由に、運用適合性を根拠として[[vLLM]]へpaved-pathエンジンを切り替えた。(Source: [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]])
[[NVIDIA Dynamo]] の公式ドキュメントは、[[KVBM (KV Block Manager)]] の Feature Support Matrix で TensorRT-LLM を vLLM と並ぶ対応フレームワークとして挙げる。専用コネクタモジュール経由で KVBM のブロック指向メモリインターフェースと統合し、GPU HBM を超える KV キャッシュを [[NIXL]] 経由で CPU DRAM・SSD・リモートストレージへオフロードできる。(Source: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]])
Wan+ のサーベイ([[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]], Table 2)は、TensorRT-LLM を Training・Fine-Tuning に非対応で Inference のみ対応する推論専用フレームワークとして位置づける。TensorRT エンジン上に FasterTransformer の最適化済みカーネルを統合し、3D Parallelism・PagedAttention・継続バッチング・量子化(GPTQ・AWQ・SmoothQuant)を主要機能とし、Triton Inference Server とのシームレスな統合を特徴とする。同じく推論専用の [[vLLM]] とは Multi-LoRA(vLLM)対 Triton Inference Server 統合(TensorRT-LLM)という周辺機能で差が付く。(Source: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]])
## 関連
- 開発元: [[NVIDIA]]
- 関連ツール: [[GenAI-Perf]] / [[NVIDIA NIM]] / [[Triton Inference Server]]
- 概念: [[LLM推論]]
- 移行事例: [[@2026__Netflix TechBlog__In-House LLM Serving at Netflix]]([[Netflix]] → [[vLLM]])
- ソース: [[@2025__NVIDIA__LLM-Inference-Benchmarking-Fundamental-Concepts]]
- KV キャッシュ統一メモリ層への統合: [[@2026__NVIDIADynamoDocs__KVBM (KV Block Manager) 概要]]([[KVBM (KV Block Manager)]] / [[NVIDIA Dynamo]])
- フレームワーク機能比較: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]]([[vLLM]] / [[Text-Generation-Inference (TGI)]] / [[RayLLM]] と並ぶ推論専用フレームワーク)