# Alibaba HPN [[Alibaba Cloud]] が SIGCOMM 2024(Qian ほか)で発表した LLM 訓練専用データセンターネットワーク(High-Performance Network)。従来の 3 層 Clos ネットワークでは LLM 訓練の少数 elephant flow パターンと ToR 単一障害点問題に対応できないという問題意識から設計された。 ## アーキテクチャ概要 - **2 層デュアルプレーンバックエンドネットワーク**: 1 Pod 内に 15K GPU を収容(従来 Clos の 4K GPU 比) - **非スタック型デュアル ToR**: 2 台の ToR を直接リンクなしに独立させ、BGP で障害時に自律収束。スタック型デュアル ToR の連鎖障害問題(本番障害の 40% 以上)を解決 - **レール最適化ネットワーク(Tier1)**: 51.2Tbps シングルチップスイッチ × 16 台で 1024 GPU(1 セグメント)を接続。本番 LLM ジョブの 96.3% が 1 セグメント内に収まり最高性能を享受 - **デュアルプレーン(Tier2)**: ToR をプレーングループに分類し、フロー経路を Tier2 入口で一意に決定。ハッシュ偏極を排除し、クロスセグメントトラフィックで最大 71.6% 性能向上 - **フロントエンドネットワーク**: 管理・推論・ストレージを担う独立した 3 層 Clos(1:1 オーバーサブスクリプション) ## 本番実績(8 ヶ月以上) - DCN+(前世代 3 層 Clos)比でエンドツーエンド LLM 訓練スループット **+14.9%** - AllReduce 最大 **+59.3%**、マルチ AllReduce 最大 **+158.2%**(NCCL 2.18.3) - ToR 単一障害点による停止: **ゼロ件** - NIC–ToR リンク障害時の訓練影響: 停止ではなく **6.25% の性能劣化**にとどまる ## SkeletonHunter との関係 [[SkeletonHunter]] は HPN の rail-optimized 構造を前提とし、full-mesh から同一 rail 外のペアを除く基本 ping リストを構成する(8 GPU/8 RNIC のホストで 87.5% 削減)。HPN の rail-optimized 構造が障害箇所特定のコンテキストになっている。(Source: [[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]]) ## 設計の比較優位 | ネットワーク | GPU 数(Pod) | 層数 | 経路選択複雑度 | |---|---|---|---| | HPN | 15,360 | 2 | O(60) | | NVIDIA SuperPod | 16,384 | 3 | O(4096) | | Google Jupiter | 26,000 | 3 | O(2048) | | Fat tree (k=48) | 27,648 | 3 | O(2304) | ## 関連 - ソース: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]] / [[@2025__SIGCOMM__SkeletonHunter - Diagnosing and Localizing Network Failures in Containerized Large Model Training]] - 開発機関: [[Alibaba Cloud]] / [[Alibaba Group]] - 関連システム: [[SkeletonHunter]] - 概念: [[RDMAネットワーク監視]] / [[LLM分散学習]] / [[集合通信]] / [[耐障害LLM訓練]] / [[RDMA]]