# FasterTransformer
## 概要
NVIDIA が開発したオープンソースの GPU ベース Transformer 推論エンジン。テンソル並列(TP)・パイプライン並列(PP)をサポートするが、オフロードやイテレーションレベルスケジューリングは持たない。線形射影・位置バイアス・内積・softmax などを単一の高性能カーネルへ手動融合し、共有メモリでのキャッシング、warp-shuffle 命令、HMMA(半精度行列乗算・累積)とテンソルコア、複数精度対応など複数のカーネル最適化技術を用いる。優先最適化目標はレイテンシ(Lat)。
KV キャッシュ管理では、最大シーケンス長を仮定した連続メモリを事前確保する素朴な方式を取るため、可変長リクエストや複雑なデコーディングシナリオ(ビームサーチ・並列デコーディング)でメモリを浪費するとして、[[vLLM]] の Paged Attention 等の対比対象として言及される。
## 関連
- [[vLLM]] / [[TensorRT-LLM]] / [[LightLLM]]
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 3.2 Taxonomy - System Optimization]]
- [[@2025__ACM Computing Surveys__Towards Efficient Generative Large Language Model Serving - Chapter 4 Software Frameworks]]
## 出典
- Xupeng Miao et al., "Towards Efficient Generative Large Language Model Serving: A Survey from Algorithms to Systems", *ACM Computing Surveys* 58(1):15, 2025, §3.2.5, §4, Table 2.