# ServeGen
[[Alibaba Group]] と [[Peking University]] が NSDI '26 で発表したオープンソースの LLM サービングワークロード生成フレームワーク(https://github.com/alibaba/ServeGen)。[[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]] の本体成果物であり、Alibaba Cloud Model Studio の本番クラスタから収集した4か月・12モデル・35.4億リクエストの特性化で得た発見に基づき設計される。
クライアントを中心に据え、Client Generator が事前設定済みの Client Pool からサンプリングするか、ユーザー指定のカスタムクライアント(Trace + Dataset)を選択して各クライアントを特性化し、Timestamp Sampler と Request Data Sampler が総到着レートに応じてクライアントレートをスケーリングしながらリクエストを合成する。到着トレースとデータセットを独立に単純合成する従来の NAIVE アプローチと異なり、クライアント単位の因果モデリング(少数の上位クライアントのレート変動がワークロード全体の変動パターンを支配するという知見)を生成の基本単位とする点が新規性である。
インスタンスプロビジョニングと [[Prefill-Decode分離]] の2つのケーススタディで、NAIVE ワークロードによるベンチマークが実際のシステム性能を見誤らせる(NAIVE は実ワークロードより「処理しやすく」見え、過小プロビジョニングや誤った PD 構成選択を招く)ことを示し、ServeGen で生成したワークロードがより正確なベンチマーク結果を導くことを実証した。秘匿性への配慮から、公開データはフルサンプルではなくパラメータ化・サニタイズされた形式(会話はハッシュ化トークン)に限定される。(Source: [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]])
## 関連
- ソース: [[@2026__NSDI__ServeGen - Workload Characterization and Generation of Large Language Model Serving in Production]]
- 開発元: [[Alibaba Group]] / [[Peking University]]
- 開発者: [[Yuxing Xiang]] / [[Xue Li]] / [[Kun Qian]] / [[Yan Zhang]] / [[Wenyuan Yu]] / [[Ennan Zhai]] / [[Xin Jin]] / [[Jingren Zhou]]
- 関連システム: [[BurstGPT]]
- 関連概念: [[Prefill-Decode分離]] / [[ワークロードの特性の把握]]