# MRC
## 定義
MRC(Multipath RC)は [[RDMA]] の RC(Reliable Connection)トランスポートを拡張した新トランスポート機構である。従来の RC は 1 キューペアが 1 パスに固定される単一経路転送だが、MRC では 1 キューペアが数百の並列パスへ同時にパケットスプレーを行う。[[OpenAI]] が開発し、10 万 GPU 超の LLM 訓練クラスタで本番実証した。(Source: [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]])
主要特性:
- **自動輻輳回避**: 輻輳したパスを動的に避けてトラフィックを再分散する
- **マイクロ秒級回復**: リンク障害時に再訓練なしでマイクロ秒単位で回復する
- **フロー衝突排除**: 均等分散により単一パス過負荷を防ぐ
## 横断的知見
- MRC は [[RDMA]] の単一パス制約を「1 キューペア = 数百パスのスプレー」として解くアプローチであり、既存の ECMP ハッシュベース多経路と根本的に異なる。ECMP はフロー単位で経路を固定するため衝突が生じるが、MRC はパケット粒度で分散する。(Source: [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]])
- [[RDMA]] ページで示された PFC pause や head-of-line blocking 問題は、MRC のパス分散によって根本的に緩和できると考えられるが、PFC との相互作用は未確認。(Source: [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]], [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]])
- JANOG58 の発表は MRC を「OpenAI 主導で AMD・Broadcom・Intel・Microsoft・NVIDIA と連携開発するオープンプロトコル」と位置づけ、UEC(Ultra Ethernet Consortium)による UET(Ultra Ethernet Transport)の仕様の一部(packet spraying・congestion notification・packet trimming)を取り込んでいると説明する。これは LinkedIn 記事にはない「業界標準化(UEC/UET)との関係」という新たな横断的視点であり、MRC が単独技術ではなくオープンな業界連携の中に位置づけられていることを示す。(Source: [[@2026__JANOG58__AIインフラ時代のデータセンター内光配線の実践知]])
## 未解決の問い
- MRC と ECMP/WCMP の多経路は何が根本的に違うのか。パケット粒度スプレーの実装詳細(順序保証はどう扱うか)はどうなっているか。
- MRC は RoCEv2 上で動作するか、それとも独自のネットワーク層を必要とするか。
- [[RDMA]] ページで指摘されている PFC pause との相互作用はどうなるか。MRC がパケットスプレーをすることで PFC の動作はどう変わるか。
- 元となる OpenAI 研究論文の詳細(アーキテクチャ、評価手法、ベンチマーク数値)は arXiv 2605.04333「Resilient AI Supercomputer Networking using MRC and SRv6」で確認できる可能性がある(JANOG58 スライド p.44 出典表記、本文未読・要検証)。
- MRC が取り込んだとされる UET の packet spraying・congestion notification・packet trimming は、UET 仕様全体のうちどの範囲か。UEC への正式な仕様提出・標準化状況はどうなっているか。
## 関連
- 概念: [[RDMA]] / [[SRv6]] / [[マルチプレーンClosトポロジ]] / [[LLM分散学習]] / [[集合通信]]
- ソース: [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]]
## 出典
- [[@2026__LinkedIn__Resilient AI Supercomputer Networking - How MRC and SRv6 Keep 100,000+ GPUs Training]]