# Junhao Hu Peking University / Key Lab of HCST (PKU), MOE 所属の研究者。DeepServe 論文([[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]]、USENIX ATC '25)の筆頭著者で、Huawei Cloud でのインターン期間中に本研究を完成させた(email: [email protected])。DeepServe では、サーバーレスAI基盤の request-job-task 抽象化・サービングエンジン FlowServe・PD-awareスケジューリング・高速スケーリングの設計を主導した。(Source: [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]]) DeepServe の参考文献リストには、Junhao Hu を共著者とする関連の先行研究として、position-independent caching を扱う「EPIC: Efficient Position-Independent Caching for Serving Large Language Models」(ICML 2025)と、推論時の attention sparsity を扱う「RaaS: Reasoning-aware Attention Sparsity for Efficient LLM Reasoning」(ACL 2024)が挙げられている(いずれも未取り込み)。いずれも LLM サービングにおける KV キャッシュ・推論効率化という一貫した研究テーマを示す。(Source: [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]] References [14][15]) ## 関連 - 所属: [[Peking University]] / Key Lab of HCST (PKU), MOE / [[Huawei Cloud]](インターン) - ソース: [[@2025__ATC__DeepServe - Serverless Large Language Model Serving at Scale]] - 共著者: [[Tao Xie]] / [[Xusheng Chen]] / [[Yizhou Shan]] - 関連概念: [[Prefill-Decode分離]] / [[KVキャッシュ管理]]