# Pingmesh
Pingmesh は [[Microsoft]] が開発した大規模データセンターネットワークのレイテンシ計測・分析システムである([[@2015__SIGCOMM__Pingmesh - A Large-Scale System for Data Center Network Latency Measurement and Analysis]]、SIGCOMM 2015)。2012年6月に主要機能が完成し、論文執筆時点(2015年)で4年以上・数十のデータセンターで稼働し、1日24テラバイト・2000億件超のプローブを生成する。
全サーバに Pingmesh Agent をインストールし、Pod内・ToR間(intra-DC)・データセンター間(inter-DC)の3階層の完全グラフで TCP/HTTP ping を常時実行することで、最大到達可能なレイテンシデータのカバレッジを実現する。収集データからネットワークSLA(パケットドロップ率・P99レイテンシ)の定義・追跡、サービス障害のネットワーク起因判定、パケットブラックホール・ランダムサイレントドロップという2種類のスイッチのサイレントパケットドロップの検知・局所化を行う。
## 主な貢献・特徴
- 全サーバ参加・常時稼働という設計選択により、live-site インシデント発生時にすでにレイテンシデータが存在する状態を実現。
- Pingmesh Controller・Pingmesh Agent・Data Storage and Analysis(DSA、[[Microsoft]] の Cosmos/SCOPE 基盤を利用)の疎結合な3コンポーネント構成により、Inter-DC対応・QoS監視・VIP監視・サイレントパケットドロップ検知・サービス向けメトリクスという後発の機能拡張をアーキテクチャ変更なしに追加できた。
- SYN/SYN-ACK の RTT からパケットドロップ率を推定するヒューリスティックにより、専用のパケットロス計測機構を持たずにネットワークSLAを算出する。
- Pod-pair 単位のP99レイテンシをグリーン/イエロー/レッドでヒートマップ表示する可視化により、Podset障害・Spine層障害等の障害パターンを視覚的に判別可能にした。
## 関連
- [[@2015__SIGCOMM__Pingmesh - A Large-Scale System for Data Center Network Latency Measurement and Analysis]](原論文)
- [[R-Pingmesh]] — [[Douyin Vision]] が SIGCOMM 2024 で発表した、Pingmesh の設計思想を RoCE ネットワークへ拡張した後続システム。
- 開発元: [[Microsoft]]
- 著者: [[Chuanxiong Guo]](筆頭著者)・[[David Maltz]]
- 関連概念: [[ネットワーク監視]] / [[データセンターネットワーク信頼性]]