# OpenLLM BentoML が本番環境での LLM サービング・微調整向けに開発したフレームワーク。BentoML エコシステムに組み込まれ、自己ホスティングと他クラウドサービスとの統合を容易にする。柔軟性・SOTA LLM サポート・簡素化された API を重視し、Docker イメージの自動生成、BentoML クラウドプラットフォーム経由のサーバーレスエンドポイントとしてのサービングに対応する。GPTQ・AWQ・SqueezeLLM・SpQR・LLM.int8 の量子化技術を統合し、Prometheus メトリクスとロギングツールによる監視機能を備える。学習(Training)には非対応で、Fine-Tuning と Inference のみに対応する中間カテゴリのフレームワーク。(Source: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]], Table 2) ## 関連 - ソース: [[@2024__TMLR__Efficient Large Language Models - A Survey - Chapter 4 LLM Frameworks]] - 開発機関: BentoML - 隣接エンティティ: [[LLM Foundry]](同じく学習非対応・微調整/推論対応のカテゴリ) - 概念: [[LLM推論]] / [[モデル圧縮]]