# 高火力 PHY [[SAKURA Internet]] が提供する GPU ベアメタルサーバーサービス。最新 GPU を 8 枚搭載した高性能サーバーを提供し、LLM の分散推論基盤構築に利用される。([[@2025__さくらのナレッジ__分散推論基盤やその前提の考え方]]) HGX H100 サーバー(H100 GPU × 8、NVLink 接続、400 Gbps NIC × 8)を提供する。NVLink によるノード内 GPU 間高速通信と、400 Gbps NIC による高帯域ノード間接続を備え、PD 分離構成で必要となる大規模な KV Cache 転送(GB オーダー)に対応できるインフラを提供する。 [[SAKURAONE]] の基盤プラットフォームでもある(SAKURAONE は 800 GPU 規模の AI–HPC クラスタ)。連載「高火力 PHY で作る分散推論基盤」では、このプラットフォームを使った LLM 分散推論基盤の設計・実装・性能検証を 4〜5 回にわたって取り上げる予定。 第 3 回 vLLM roundup Community Meetup Tokyo の資料では、高火力 PHY の 1 サーバー規模を想定し、NVLink は利用するが外部インターコネクトは使わない条件で PD Disaggregation を評価した。さらに別サーバー上の Mooncake Store を KV Cache Store として用い、リモート KV Cache Reuse/Sharing の効果を検証している。([[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]]) ## 関連 - 提供元: [[SAKURA Internet]] - 関連エンジニア: [[道下幹也]] - 関連プロダクト: [[SAKURAONE]] - 本ソース: [[@2025__さくらのナレッジ__分散推論基盤やその前提の考え方]] / [[@2026__SpeakerDeck__推論基盤のパフォーマンス検証と最適化戦略]]