# 紹介: Hostping: Diagnosing Intra-host Network Bottlenecks in RDMA Servers Navigation: [[index]] | [[wiki/sources/@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers|Hostping (source)]] ## 紹介文 - RNIC の線速が 25Gb/s から 200Gb/s 級へ伸びる一方、PCIe やメモリチャネルなどのホスト内帯域は追いつかず、RDMA の新たなボトルネックになりつつある。 - 単一ホストの劣化が分散機械学習システム全体の性能を大きく落とすのに、既存ツールではネットワーク側とホスト内の原因をすぐに切り分けにくい。 - Hostping は RNIC と GPU・メモリなどのエンドポイント間でネットワーク外のループバックテストを行い、ホスト内レイテンシと帯域を直接測る。 - Hardware Monitor・Hostping Engine・Data Analyzer を組み合わせ、ホストの稼働状態に応じて能動プロービングとバス使用率監視を切り替える。 - アイドル時は全経路の結果から binary network tomography でリンク障害を推定し、混雑時は同一 root port 配下の相対比較で障害と輻輳を見分ける。 - Intel Xeon・Nvidia A100・Mellanox CX6-DX を含む 300 台超の本番 RDMA サーバへ展開し、アイドル時とサービストラフィック下の両方で検証した。 - わずか 1.4 µs の追加レイテンシでホスト内帯域が約 40%落ちるなど、経路の長さが性能へ直結することを示した。 - 既知の RNIC・GPU PCIe、メモリチャネル、UPI 障害に加え、CPU root port 障害やメモリチャネルのフラッピング、ACS/ATS などの設定ミスを継続監視で発見した。 - 混雑時にも UPI やメモリチャネルの過負荷による異常経路を、エンドポイント間の相対比較で絞り込めた。 - ベンダー固有ツールを組み合わせず低オーバーヘッドで RDMA サーバへ展開でき、出荷時や再起動後の予防的な健全性確認にも向く一方、過負荷の原因となるトラフィック源の自動特定などは今後の課題として残る。 --- Kefei Liu et al. (BUPT; ByteDance Inc.), "Hostping: Diagnosing Intra-host Network Bottlenecks in RDMA Servers," NSDI:'23, 2023. https://www.usenix.org/conference/nsdi23/presentation/liu-kefei ## 出典 - [[wiki/sources/@2023__NSDI__Hostping - Diagnosing Intra-host Network Bottlenecks in RDMA Servers|Hostping]]