# Mellanox 高性能ネットワーキングの NIC(ConnectX シリーズ)およびスイッチを設計・製造するイスラエル発の企業。2020 年に NVIDIA に買収され、現在は NVIDIA Networking(旧 Mellanox)として InfiniBand・Ethernet HPC 製品群を展開している。 ## DCQCN との関係 SIGCOMM 2015 の DCQCN 論文([[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]])では、[[Microsoft]] とともに共同著者として参加。Haggai Eran・Yehonatan Liron・Shachar Raindel・Mohamad Haj Yahia の 4 名が Mellanox 所属。 DCQCN の NP・RP 状態機械を **ConnectX-3 Pro** NIC のハードウェアに実装した。ConnectX-3 Pro は 1〜5 µs に 1 CNP を生成でき 10〜20 輻輳フローに対応、後継 **ConnectX-4** は 200 フロー超に対応する。Microsoft のデータセンターで DCQCN を本番展開する際のハードウェアパートナー。 ## 主な貢献 - [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]]: DCQCN NIC 実装の共同設計者。ConnectX-3 Pro / ConnectX-4 への実装を担当。 - [[@2018__SIGCOMM__Revisiting Network Support for RDMA]]: IRN(Improved RoCE NIC)の共著者。[[Alexander Shpiner]]・[[Eitan Zahavi]] が Mellanox 所属として参加し、PFC を不要にする RoCE NIC 設計変更の実現可能性を商用ベンダーの立場から検証。著者らとの議論を経て、次リリースで IRN の一版実装を検討していると論文中に記載されている。 ## SHArP: InfiniBand スイッチへの網内集約オフロード [[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]](COM-HPC '16)は、Mellanox の SwitchIB-2 ASIC に集団操作(collective operation)の縮約処理をオフロードする Scalable Hierarchical Aggregation Protocol(SHArP)を提案した。Richard L. Graham・Devendar Bureddy・Pak Lui・Hal Rosenstock・Gilad Shainer(Sunnyvale, California 拠点)と Gil Bloch・Dror Goldenberg・Mike Dubman・Sasha Kotchubievsky・Vladimir Koushnir・Lion Levi・Alex Margolin・Tamir Ronen・[[Alexander Shpiner]]・Oded Wertheim・[[Eitan Zahavi]](Yokneam, Israel 拠点)が著者に名を連ねる。128 ホストでの MPI Allreduce() レイテンシを最大 2.1〜3.24 倍改善した。詳細は [[インネットワーク集約]] concept を参照。 ## XDP論文の評価環境での役割 XDP(eXpress Data Path)論文の性能評価は、Mellanox ConnectX-5 Ex VPI デュアルポート100Gbpsネットワークアダプタ2枚(mlx5ドライバ対応)を搭載した実験機で行われた。パケットドロップ性能とDPDKとの性能差の分析(§4.4)では、mlx5ドライバがパケット1個の処理につき10回の関数呼び出しを行うことが、XDPとDPDKの性能差18.7 nsのうち13 nsに対応すると分析されている。(Source: [[@2018__CoNEXT__The eXpress Data Path - Fast Programmable Packet Processing in the Operating System Kernel]] §4, §4.4) ## mlx5 ドライバの ethtool カウンタ体系 ConnectX シリーズを駆動する Linux カーネルドライバ `mlx5` は、Ring/Netdev・vPort・Physical Port・Priority Port・Device の 5 計測点に分かれた ethtool カウンタ群を公開する。[[@2023__LinuxKernelDocs__mlx5 Ethtool Counters]] はこの一次仕様書で、`rx_discards_phy`(輻輳)・`rx_pcs_symbol_err_phy`/`rx_corrected_bits_phy`(リンク品質・FEC)・`module_bus_stuck`(光モジュール障害)・`rx_pci_signal_integrity`(PCIe 信号品質)といったカウンタを定義する。これらのカウンタ名は [[RDMAネットワーク監視]] concept が集約する研究群(例: Lumina の `rx_discards_phy` 参照)で実際に引用される。 ## 関連 - 概念: [[RDMA]] / [[データセンター輻輳制御]] / [[RDMAネットワーク監視]] / [[インネットワーク集約]] / [[XDP]] - 共著組織: [[Microsoft]] - ソース: [[@2023__LinuxKernelDocs__mlx5 Ethtool Counters]] / [[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]] / [[@2018__CoNEXT__The eXpress Data Path - Fast Programmable Packet Processing in the Operating System Kernel]] - 所属研究者: [[Alexander Shpiner]] / [[Eitan Zahavi]] / [[Richard L. Graham]] / [[Devendar Bureddy]] / [[Pak Lui]] / [[Hal Rosenstock]] / [[Gilad Shainer]] / [[Gil Bloch]] / [[Dror Goldenberg]] / [[Mike Dubman]] / [[Sasha Kotchubievsky]] / [[Vladimir Koushnir]] / [[Lion Levi]] / [[Alex Margolin]] / [[Tamir Ronen]] / [[Oded Wertheim]] ## 出典 - [[@2023__NSDI__SRNIC - A Scalable Architecture for RDMA NICs]](Mellanox CX-5/CX-6が接続スケーラビリティ問題の比較baselineとして分析される) - [[@2014__NVIDIA Developer Blog__Benchmarking GPUDirect RDMA on Modern Server Platforms]](Connect-IB/ConnectX-3 HCAでのGPUDirect RDMA性能ベンチマークに機材提供)