# オープンネットワーキング ## 定義 オープンネットワーキング(open, disaggregated networking)は、network operating system(NOS)を switching ASIC から切り離し、ベンダ中立な部品をコミュニティ主導で組み上げることでデータセンターファブリックを構成する設計思想。Switch Abstraction Interface(SAI)の OCP 採用以降、ハードウェアとソフトウェアの分離が進み、[[SONiC]] のような NOS が多様な ASIC を統一制御する。これはベンダロックインを緩和し、参入障壁を下げ、ハードウェアとソフトウェアを独立に進化させる。([[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] §2) AI/HPC ファブリックでは、RoCEv2(RDMA over Converged Ethernet)が要求するロスレスな Ethernet——PFC(Priority Flow Control)と ECN(Explicit Congestion Notification)——を SONiC が提供し、EVPN/VXLAN によるスケーラブルなオーバーレイと合わせて、プロプライエタリな InfiniBand に代わる本番運用に耐える選択肢となる。 ## 横断的知見 - **RoCE/lossless Ethernet の運用課題は監視で顕在化する**: [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]] は RoCE クラスタ固有の障害(PFC deadlock、PFC storm、QPC キャッシュ消費、silent drop、PFC 未設定/設定ミス)を市販 RNIC で検知・箇所特定する(表2 の 14 種問題)。[[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] が SONiC+RoCEv2 で「ファームウェア・カーネル・RDMA スタックの版整合と ECN 閾値・PFC・NCCL channel striping の精緻な調整」を運用負荷として挙げた(§8.1)のと同根で、Ethernet ベース AI ネットワークの「自由度の代償」が監視・診断の必要性として現れる。一方は監視で課題を可視化し、他方は構築側の運用負荷として記述する、表裏の関係。(Source: [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]], [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]) - **同一レール相互接続による Ethernet スケーリング**: [[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]] は RoCE/Ethernet 上で tier-2 まで同一レール相互接続を広げ 512K GPU 規模まで線形に近くスケールさせ(8K GPU で効率損失 0.6%、全階層同一帯域)、InfiniBand 専有でなくとも超大規模 LLM 訓練のネットワークを構築できることを示す。[[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]](中規模・フルオープンスタック)と Astral(超大規模、Tencent)は規模帯は違えど「Ethernet ベースで AI-HPC を成立させる」方向で連続する。ただし SAKURAONE が SONiC によるベンダ中立・フルオープンを志向するのに対し、Astral はオープン性の度合いを明示しない自社インフラである点で、「Ethernet 化」と「オープン化」は別軸であることも示す。(Source: [[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]], [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]) - **RoCE/Converged Ethernet の運用代償が経路最適化と因果診断を要求する**: [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]] の C4(Calibrating Collective Communication over Converged Ethernet)は Converged Ethernet 上の[[集合通信]]に対し、C4P で[[RDMA]]接続の動的負荷分散とパス探査によるフォルトリンク回避を行い、単一 allreduce の実効帯域を 240→360Gbps へ引き上げる。[[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]] は lossless Ethernet の PFC が持つ連鎖的輻輳拡散(backpressure→storm→deadlock)を、データプレーン内の PFC 因果関係解析で 90% 以上の精度で診断する。両者は、InfiniBand 代替としての RoCE/Converged Ethernet が抱える PFC 由来の複雑性を、それぞれ経路最適化(C4P)と因果診断(Hawkeye)で補償している。SAKURAONE §8.1 の「ECN 閾値・PFC・NCCL channel striping の精緻な調整」という運用負荷や R-Pingmesh の表2(PFC deadlock/storm 等 14 種)と同根で、vendor-neutral fabric の自由度の代償として cross-layer の監視・チューニングが要るという既存知見の具体例になる。(Source: [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]], [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]]) - **SONiC の役割が NOS から Scale-Up プロトコルスタック実装へ拡張されつつある**: [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]] は、SONiC Scale-Up Working Group(2025-04 発足、Alibaba・Microsoft・Broadcom・NVIDIA 等 13 社参加)が Scale-Up Ethernet 向けの LLR・CBFC・LLDP Custom TLV を SONiC/SAI に実装中であることを報告する。従来の SONiC は Scale-Out ファブリックの NOS としての役割が中心であったが、OCP ESUN(Ethernet Scale-up Networking)の Base Specification 1.0(2026-02-09)を起点に Scale-Up 領域にも拡張されている。[[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] が SONiC を Scale-Out の RoCEv2 ファブリック運用で示したのと並行して、同じオープンスタックが NVLink 代替を目指す Scale-Up 層にも延伸しつつある。(Source: [[@2026__SONiC Workshop Japan 2026__SONiC Scale-Up Working Group から探る Scale-Up や Ultra Ethernet 機能の実装方法]], [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]) - **DCN 設計の「最後の一マイル」——スイッチ設定生成——は依然として産業の暗黙知だった**: [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]] は、トポロジー選択(Clos 設計・Jupiter・Condor)や物理配備計画の研究が盛んな一方で、「論理設計を具体的なスイッチ設定に翻訳する」ステップが学術・産業ともに見過ごされてきたと指摘する。既存のオープンネットワーキング研究はトポロジー最適化と監視診断に集中し、「設定生成の自動化」というワークフロー自体を明示的に研究対象にしてこなかった。Matryoshka は 6 年・約 900 DCN の本番で埋めた空白として、オープンネットワーキング研究の前段のフェーズを成立させる基盤層がインテント駆動コンパイルであることを示す。(Source: [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]]) - **ベンダ中立な設定抽象化(GSC)は、オープンネットワーキングの「ハードウェア分離」を設定生成レイヤーまで延長する**: オープンネットワーキングが ASIC から NOS を切り離すのに対し、Matryoshka の Generic Switch Configuration(GSC)は論理設計からベンダ固有設定を切り離す。FBOSS(Meta 内製)から外部ベンダスイッチまで同一 GSC で表現し、ベンダ別レンダリングに委ねる。SONiC が ASIC 間のインタフェースを SAI で統一するのと同型の分離が、設定生成パイプラインにも適用されている。(Source: [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]], [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]]) ## 未解決の問い - オープンな Ethernet ファブリック(SONiC/RoCEv2)は InfiniBand 級の集団通信性能を出せるが、[[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] §8.1 は「ファームウェア・カーネル・RDMA スタックの版整合と、ECN 閾値・PFC・NCCL channel striping の精緻な調整」という層を深く跨ぐ専門知を代償に要すると述べる。この調整コストは [[@2024__NSDI__MegaScale - Scaling Large Language Model Training to More Than 10,000 GPUs]] の自社データセンターネットワークのチューニングや [[@2026__Vicinagearth__Efficient Training of Large Language Models on Distributed Infrastructures - A Survey]] の通信最適化と比べてどれだけ大きいか。オープン化の TCO 優位はこの運用負荷を吸収できるか。 - RoCEv2 の輻輳制御は DCQCN(Zhu 2015)を基盤とするが、SAKURAONE は ECN max marking probability を 1% と保守的に設定し PFC 依存を許容した(§8.2、表15)。この「PFC 寄り」設定はワークロード特性でどう変えるべきか。ECN 主体に振った場合のスループットへの影響は。 - ECN marking rate / PFC pause counter を実運用で継続収集し、観測帯域を輻輳に帰属できるようにするには、どのテレメトリを [[テレメトリ]] 層に統合すべきか(SAKURAONE は観測期間中これらを未収集 §7.2)。 - 全階層同一帯域(Astral、オーバーサブスクリプションなし)とフルオープンスタック(SAKURAONE)はどの GPU 規模・コスト帯で両立するか。Astral は 512K GPU で同一帯域を、SAKURAONE は中規模でオープン性を取る——両立点があるのか、規模かオープン性のいずれかを諦める領域があるのか。 - RoCE 監視(`[[RDMAネットワーク監視]]`、R-Pingmesh の市販 RNIC・低オーバーヘッド能動プローブ)は、オープンスタック(SONiC/RoCEv2)の層を深く跨ぐ調整という運用負荷をどこまで下げられるか。監視で課題を早期に可視化することは調整コストの吸収に寄与するか。 - Matryoshka の GSC 抽象化(ベンダ非依存の設定中間表現)は SONiC の SAI(スイッチ非依存 API)と概念的に相似する。スイッチ OS レベルのオープン化(SONiC)と設定生成レベルの抽象化(GSC)を組み合わせることで、エンドツーエンドの「ベンダ非依存 DCN 管理」は成立するか。Meta のような垂直統合環境でのみ実現可能なのか、それともより広い組織に適用できるアーキテクチャパターンか。 - PFC の連鎖的輻輳(backpressure/storm/deadlock)が RoCE 固有障害の中核なら、PFC への依存を下げる lossless 実現(SAKURAONE が保守的に ECN max marking probability を 1% に置き PFC 依存を許容した §8.2 とは逆方向に、ECN 主体や別の輻輳制御へ振る)はオープンスタックでどこまで可能か。PFC を残す限り Hawkeye 型の因果診断は不可欠か。 - C4P がパス探査でフォルトリンクを回避し Hawkeye が PFC 因果を診断するように、RoCE 固有障害を運用前段で front-load する設計(障害が顕在化する前に経路計画・診断機構を fabric に組み込む)を、vendor-neutral なオープンスタック上で標準化できるか。経路最適化と因果診断を SONiC のような NOS にどう取り込むか。 ## 関連 - ソース: [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]] / [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]] / [[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]] / [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]] / [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]] / [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]] - エンティティ: [[SONiC]] / [[SAKURAONE]] / [[SAKURA Internet]] - 概念: [[LLM分散学習]] / [[GPUクラスタ運用]] / [[並列化戦略]](通信局所性 rail-optimized topology の前提) / [[RDMAネットワーク監視]] / [[テレメトリ]] - 関連 MOC: [[Network - MOC]] / [[HPC - MOC]] ## 出典 - [[@2026__MLSys2026__SAKURAONE - An Open Ethernet-Based AI HPC System]](§2 Background, §3 Motivation, §4.2 Interconnect Requirements, §8.1 System Implications, §8.2 RoCE Congestion-Control Tuning) - [[@2024__SIGCOMM__R-Pingmesh - A Service-Aware RoCE Network Monitoring and Diagnostic System]](表2 RoCE 固有 14 種問題:PFC deadlock/storm・QPC キャッシュ消費・silent drop・PFC 設定ミス、§4.2.1 市販 RNIC・UD QP による低オーバーヘッド能動プローブ) - [[@2025__SIGCOMM__Astral - A Datacenter Infrastructure for Large Language Model Training at Scale]](§2.1 RoCE/Ethernet 上の tier-2 同一レール相互接続・512K GPU・8K GPU で効率損失 0.6%・全階層同一帯域) - [[@2025__HPCA__Enhancing Large-Scale AI Training Efficiency - The C4 Solution for Real-Time Anomaly Detection and Communication Optimization]](C4P=Converged Ethernet 上の RDMA 動的負荷分散・パス探査によるフォルトリンク回避・allreduce 240→360Gbps) - [[@2025__SIGCOMM__Hawkeye - Diagnosing RDMA Network Performance Anomalies with PFC Provenance]](PFC=lossless Ethernet の連鎖輻輳 backpressure/storm/deadlock をデータプレーン内因果解析で診断、精度 90%+) - [[@2026__NSDI__Matryoshka - Realizing Hyperscale Data Center Network Design for the AI Era]](§4 設計原則: GSC による設定生成ベンダ分離・決定論的ステートレスコンパイル・トポロジーモジュラリティ、§9 関連研究: トポロジー設計 vs 設定生成の空白)