# RDMA
## 定義
RDMA(Remote Direct Memory Access)は、リモートホストのメモリへ CPU を介さず NIC が直接読み書きする通信機構である。LLM 訓練や HPC では、InfiniBand または Ethernet 上の RoCEv2 として用いられ、低レイテンシ・高帯域の GPU 間通信を支える。
## 横断的知見
- **RoCEv2 の商用 Ethernet 大規模展開を初めて体系的に報告**: [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]] は Microsoft が全データセンタで RoCEv2 を Layer-3 IP 上に展開した経験を報告した。DSCP ベース PFC で VLAN 制約を脱却し、PFC デッドロック・トランスポートライブロック・NIC PFC ストーム・スローレシーバーの 4 つの安全課題を発見・解決した。RDMA Pingmesh による能動レイテンシ監視を実装し、本番での 99 パーセンタイルレイテンシ 90 µs(TCP は 700 µs)を実証。この展開が DCQCN 採用の本番先行例となった。(Source: [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]])
- **AI 訓練クラスタにおける RoCEv2 展開は輻輳制御の再設計を要求する**: [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]] は Meta が 24,000 GPU の RoCE クラスタで Llama 3 を訓練した事例を報告した。DCQCN は集合通信パターンにはそのまま適合せず、受信側駆動のトラフィック許可制御へ転換した。ルーティングも ECMP からフローレットスイッチングへ段階的に改善し、NCCL のデフォルト性能が本番で 50% 以下になる問題をネットワーク・ライブラリ協調チューニングで 2 倍以上改善した。DCQCN 提案から約 10 年で、AI ワークロード固有の要求が輻輳制御の再設計を促している。(Source: [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]])
- **RoCEv2 と PFC による RDMA 展開の原点**: [[Microsoft]] と [[Mellanox]] は SIGCOMM 2015 で DCQCN を発表し、IP ルーティングされた大規模データセンターへの RDMA 展開を初めて実証した。PFC による無損失ファブリックと ECN ベースのフロー単位輻輳制御(DCQCN)の組み合わせという基本構造は、その後の Azure Storage・SAKURAONE・OpenAI MRC 等の大規模 RDMA 展開でも継承されている。スパインスイッチの PAUSE メッセージを 6 百万件→約 3000 件に削減し、ユーザートラフィックを 16 倍まで処理できることを 3 階層 Clos テストベッドで実証。(Source: [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]])
- [[SAKURAONE]] は SONiC + RoCEv2 の open Ethernet で MLPerf Training を実行し、InfiniBand 系に近い time-to-train を示した。ただし ECN/PFC/NCCL channel striping などのクロスレイヤ調整が必要である。([[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]])
- RDMA は高性能な一方、PFC pause、head-of-line blocking、misbehaving flow など独自の障害モードを持つため、[[RDMAネットワーク監視]] が重要になる。([[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]])
- [[集合通信]] は RDMA の性能特性に強く依存する。NCCL/NCCLX のようなライブラリは、並列化次元ごとに通信パターンを使い分ける。
- [[OpenAI]] が開発した [[MRC]](Multipath RC)は、RC トランスポートを拡張し 1 キューペアが数百パスへパケットスプレーを行う新トランスポートである。フロー衝突・インキャスト輻輳・障害収束遅延という RDMA の三大問題を一括して解き、10 万 GPU 超本番環境でトランシーバー障害やスイッチ再起動中も訓練継続を実証した。[[SRv6]] ソースルーティングおよび [[マルチプレーンClosトポロジ]] と組み合わせる「検知・回避・回復」設計は、RDMA を前提としつつもその弱点を上位レイヤで吸収する注目すべき方向性である。([[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]])
- **RDMA の本番価値は GPU/HPC だけでなくクラウドストレージの CPU 予約削減にも現れる**: [[SAKURAONE]] や OpenAI MRC は LLM/HPC の集団通信性能を中心に RDMA を扱う。一方、[[@2023__NSDI__Empowering Azure Storage with RDMA]] は [[Azure Storage]] のフロントエンド/バックエンド通信を RDMA 化し、ネットワークスタック処理の CPU コア予約を削減することを主要動機に置く。RDMA は「高速アクセラレータ間通信」の技術であると同時に、ディスアグリゲートされたクラウドストレージで CPU を顧客 VM やストレージ処理へ戻すためのコスト構造改善技術でもある。(Source: [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]], [[@2023__NSDI__Empowering Azure Storage with RDMA]])
- **クラスタ内 RDMA からリージョン内 RDMA へ広げると、性能問題はプロトコルでなく運用異種性に移る**: Azure Storage の展開は、異世代 NIC の DCQCN 実装差、異種スイッチ OS/ASIC、長距離リンクの PFC headroom、PFC と MACsec の標準解釈差、NIC firmware の head-of-line blocking などを主要課題として扱う。これは [[Hawkeye]] や [[R-Pingmesh]] が後年扱う「RDMA 性能異常はネットワークの局所故障だけでなく、制御機構・デバイス実装・運用更新の相互作用から生じる」という見方の本番先行例である。(Source: [[@2023__NSDI__Empowering Azure Storage with RDMA]], [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]], [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]])
- **RoCE の設計欠陥は学術と産業が共同で体系化する段階に入った**: [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]] は ETH Zürich・HPE・Broadcom・Google・Microsoft の共著という産学連合で RoCE の 8 つの構造的問題(PFC 過大バッファ・輻輳ツリー・Go-back-N・輻輳制御の相互不干渉性・ヘッダオーバーヘッド・スマートスタック不対応・セキュリティ・リンク信頼性)を整理し、「TCP と RoCE は 10 年以内に次世代 Ethernet に置き換わる」と予測した。DCQCN の実証([[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]])から 8 年でプロトコル自体の設計限界が IEEE の主要誌面に掲載されたことは、RoCE のライフサイクルが曲がり角を迎えていることを示す。(Source: [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]], [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]])
- **PFC の限界は帯域増大とともに指数的に悪化する構造問題である**: Hoefler+ 2023 は、スイッチ帯域が 2 年ごとに 2 倍になる(Tomahawk 系列 2014〜2022)につれて PFC ヘッドルームバッファも比例拡大し、次世代スイッチ設計の主要阻害要因になることを定量的に示した。これは [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]] が「PFC storm」の診断を課題とする背景であり、[[@2023__NSDI__Empowering Azure Storage with RDMA]] が長距離 RDMA の PFC headroom を問題視する文脈とも一致する。PFC は設計当初の「クラスタ内無損失転送」の想定を超えてリージョン間・ハイパースケール規模で使われた結果、副作用が主作用を脅かしている。(Source: [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]], [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]], [[@2023__NSDI__Empowering Azure Storage with RDMA]])
- **RoCEv2 の設計限界に対する 4 方式の応答が出揃った**: [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]] の p.6 比較表は、RoCEv2・UE Transport・Falcon v1.1・MRC の 4 方式を 12 軸で並べ、RoCEv2 のみがロスレス前提(PFC 必須)・Go-Back-N・Out-of-Order 非対応であることを可視化した。残り 3 方式はいずれもパケットロス許容・SACK・パケット粒度マルチパスを採用する。Hoefler+ 2023 が指摘した RoCE の 8 つの構造的問題のうち、Go-back-N・PFC バッファ肥大・輻輳制御の相互不干渉性の 3 つは UE Transport/Falcon/MRC が共通的に解消しており、「次世代 Ethernet への移行」が実装レベルで具体化していることを示す。さらに SONiC/SAI が UE spec v1.0.2 に基づき LLR・CBFC・LLDP を実装中であり、オープンネットワーキングスタック上で次世代プロトコルが動き始めている。(Source: [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]], [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]])
- **UE 1.0 は UET の詳細設計を公式論文で初めて開示した**: [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]] は UEC 仕様書(562 ページ)の著者自身による高レベル解説であり、EV ベースのパケットスプレー・PDC のゼロ RTT 確立・NSCC+RCCC の 2 アルゴリズム組み合わせ・TSS のゼロトラストセキュリティという 4 つの核心技術を解説した。「計算 1,000 倍・帯域 100 倍」という非対称が SACK・パケットスプレー・ゼロ RTT を今後のシリコンで合理的にする根拠として明示されており、これは RDMA の次世代標準が InfiniBand から Ethernet へ移行する構造的な理由の技術的裏付けとなっている。(Source: [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]])
- **LLM 訓練ネットワークでは ECMP ハッシュ偏極が根本問題になる**: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]] は、LLM 訓練の少数 elephant flow(各ホスト 400Gbps 瞬間飽和)が従来の多数フロー前提の ECMP を無力化することを本番データで示した。3 層 Clos では 3 段のカスケードハッシュ偏極が生じる。HPN はデュアルプレーントポロジで問題を解消した。RoCEv2 はトランスポート層をハードウェアオフロードするため、スイッチ側での動的フロービンパッキング等が困難であり、ハッシュ偏極の解決はトポロジ設計とホスト側の非重複経路計算に委ねられた。(Source: [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]], [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]])
## 未解決の問い
- DCQCN の流体モデルは固定遅延を仮定する。マルチボトルネックや 100/400 Gbps 環境でのパラメータ再チューニングはどのように行われたか。([[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]])
- RoCEv2 + open Ethernet は、どの規模・トポロジ・テナント分離条件まで InfiniBand 代替として成立するか。
- RDMA ネットワークの障害を、LLM 訓練のストラグラー・MFU 低下・ジョブ失敗へどう因果的に結びつけるか。
- RPC ワークロードで RDMA を使う場合、[[クラウドスケールRPC特性]] のレイテンシ tax と CPU tax はどう変わるか。
- [[MRC]](Multipath RC)は RC の単一パス制約をパケット粒度のスプレーで解くが、PFC pause との相互作用はどうなるか。MRC 導入で PFC の挙動は変わるか。
- RDMA failover は TCP へ戻すための CPU 余力を必要とする。クラウド事業者が RDMA で節約した CPU を顧客 VM に再配分した後、障害時のフェイルオーバー容量をどう予約・価格付け・自動化すべきか。([[@2023__NSDI__Empowering Azure Storage with RDMA]])
- Hoefler+ 2023 が予測する「次世代 Ethernet が 10 年以内に TCP/RoCE を置き換える」は 2026 年時点で具体化が進んでいる。[[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]] は SONiC/SAI が UE spec v1.0.2 に基づき LLR・CBFC・LLDP を実装中であることを示し、OCP ESUN Base Specification 1.0 が 2026-02-09 に公開された。UE Transport 自体の設計は [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]] で初めて論文として詳細に公開された(arXiv:2508.08906、2025 年 8 月)。第 1 世代製品は「数か月以内に入手可能」と予告されている。市場シェアの定量的変化は不明。([[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]], [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]], [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]])
- Go-back-N を廃止して選択的確認応答に移行する場合、アウトオブオーダー配送が可能になることで RoCE の集合通信パターン(ring-allreduce など)への影響はどの程度あるか。([[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]])
## 関連
- 概念: [[RDMAネットワーク監視]] / [[データセンター輻輳制御]] / [[オープンネットワーキング]] / [[集合通信]] / [[LLM分散学習]] / [[クラウドスケールRPC特性]] / [[Ultra Ethernet]]
- エンティティ: [[Torsten Hoefler]] / [[ETH Zürich]] / [[Hewlett Packard Enterprise]] / [[Broadcom]] / [[Microsoft]]
- ソース: [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]] / [[@2016__SIGCOMM__RDMA over Commodity Ethernet at Scale]] / [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]] / [[@2024__SIGCOMM__RDMA over Ethernet for Distributed AI Training at Meta Scale]] / [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]] / [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] / [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]] / [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]] / [[@2023__NSDI__Empowering Azure Storage with RDMA]] / [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]]
## 出典
- [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]]
- [[@2023__IEEE Computer__Datacenter Ethernet and RDMA - Issues at Hyperscale]]
- [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]
- [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]]
- [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]]
- [[@2023__NSDI__Empowering Azure Storage with RDMA]]
- [[@2024__SIGCOMM__Alibaba HPN - A Data Center Network for Large Language Model Training]]
- [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]](p.6 RoCEv2 対 UE Transport/Falcon/MRC の 12 軸比較表。SONiC/SAI が UE spec v1.0.2 に基づき LLR・CBFC・LLDP を実装中)
- [[@2025__arXiv__Ultra Ethernet's Design Principles and Architectural Innovations]](UE 1.0 の設計解説論文。EV ベーススプレー・NSCC+RCCC・PDC ゼロ RTT・TSS ゼロトラストを詳述)