# Mellanox
高性能ネットワーキングの NIC(ConnectX シリーズ)およびスイッチを設計・製造するイスラエル発の企業。2020 年に NVIDIA に買収され、現在は NVIDIA Networking(旧 Mellanox)として InfiniBand・Ethernet HPC 製品群を展開している。
## DCQCN との関係
SIGCOMM 2015 の DCQCN 論文([[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]])では、[[Microsoft]] とともに共同著者として参加。Haggai Eran・Yehonatan Liron・Shachar Raindel・Mohamad Haj Yahia の 4 名が Mellanox 所属。
DCQCN の NP・RP 状態機械を **ConnectX-3 Pro** NIC のハードウェアに実装した。ConnectX-3 Pro は 1〜5 µs に 1 CNP を生成でき 10〜20 輻輳フローに対応、後継 **ConnectX-4** は 200 フロー超に対応する。Microsoft のデータセンターで DCQCN を本番展開する際のハードウェアパートナー。
## 主な貢献
- [[@2015__SIGCOMM__Congestion Control for Large-Scale RDMA Deployments]]: DCQCN NIC 実装の共同設計者。ConnectX-3 Pro / ConnectX-4 への実装を担当。
- [[@2018__SIGCOMM__Revisiting Network Support for RDMA]]: IRN(Improved RoCE NIC)の共著者。[[Alexander Shpiner]]・[[Eitan Zahavi]] が Mellanox 所属として参加し、PFC を不要にする RoCE NIC 設計変更の実現可能性を商用ベンダーの立場から検証。著者らとの議論を経て、次リリースで IRN の一版実装を検討していると論文中に記載されている。
## SHArP: InfiniBand スイッチへの網内集約オフロード
[[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]](COM-HPC '16)は、Mellanox の SwitchIB-2 ASIC に集団操作(collective operation)の縮約処理をオフロードする Scalable Hierarchical Aggregation Protocol(SHArP)を提案した。Richard L. Graham・Devendar Bureddy・Pak Lui・Hal Rosenstock・Gilad Shainer(Sunnyvale, California 拠点)と Gil Bloch・Dror Goldenberg・Mike Dubman・Sasha Kotchubievsky・Vladimir Koushnir・Lion Levi・Alex Margolin・Tamir Ronen・[[Alexander Shpiner]]・Oded Wertheim・[[Eitan Zahavi]](Yokneam, Israel 拠点)が著者に名を連ねる。128 ホストでの MPI Allreduce() レイテンシを最大 2.1〜3.24 倍改善した。詳細は [[インネットワーク集約]] concept を参照。
## XDP論文の評価環境での役割
XDP(eXpress Data Path)論文の性能評価は、Mellanox ConnectX-5 Ex VPI デュアルポート100Gbpsネットワークアダプタ2枚(mlx5ドライバ対応)を搭載した実験機で行われた。パケットドロップ性能とDPDKとの性能差の分析(§4.4)では、mlx5ドライバがパケット1個の処理につき10回の関数呼び出しを行うことが、XDPとDPDKの性能差18.7 nsのうち13 nsに対応すると分析されている。(Source: [[@2018__CoNEXT__The eXpress Data Path - Fast Programmable Packet Processing in the Operating System Kernel]] §4, §4.4)
## mlx5 ドライバの ethtool カウンタ体系
ConnectX シリーズを駆動する Linux カーネルドライバ `mlx5` は、Ring/Netdev・vPort・Physical Port・Priority Port・Device の 5 計測点に分かれた ethtool カウンタ群を公開する。[[@2023__LinuxKernelDocs__mlx5 Ethtool Counters]] はこの一次仕様書で、`rx_discards_phy`(輻輳)・`rx_pcs_symbol_err_phy`/`rx_corrected_bits_phy`(リンク品質・FEC)・`module_bus_stuck`(光モジュール障害)・`rx_pci_signal_integrity`(PCIe 信号品質)といったカウンタを定義する。これらのカウンタ名は [[RDMAネットワーク監視]] concept が集約する研究群(例: Lumina の `rx_discards_phy` 参照)で実際に引用される。
## 関連
- 概念: [[RDMA]] / [[データセンター輻輳制御]] / [[RDMAネットワーク監視]] / [[インネットワーク集約]] / [[XDP]]
- 共著組織: [[Microsoft]]
- ソース: [[@2023__LinuxKernelDocs__mlx5 Ethtool Counters]] / [[@2016__COM-HPC__Scalable Hierarchical Aggregation Protocol (SHArP) - A Hardware Architecture for Efficient Data Reduction]] / [[@2018__CoNEXT__The eXpress Data Path - Fast Programmable Packet Processing in the Operating System Kernel]]
- 所属研究者: [[Alexander Shpiner]] / [[Eitan Zahavi]] / [[Richard L. Graham]] / [[Devendar Bureddy]] / [[Pak Lui]] / [[Hal Rosenstock]] / [[Gilad Shainer]] / [[Gil Bloch]] / [[Dror Goldenberg]] / [[Mike Dubman]] / [[Sasha Kotchubievsky]] / [[Vladimir Koushnir]] / [[Lion Levi]] / [[Alex Margolin]] / [[Tamir Ronen]] / [[Oded Wertheim]]
## 出典
- [[@2023__NSDI__SRNIC - A Scalable Architecture for RDMA NICs]](Mellanox CX-5/CX-6が接続スケーラビリティ問題の比較baselineとして分析される)
- [[@2014__NVIDIA Developer Blog__Benchmarking GPUDirect RDMA on Modern Server Platforms]](Connect-IB/ConnectX-3 HCAでのGPUDirect RDMA性能ベンチマークに機材提供)