# LDMS
Lightweight Distributed Metric Service。[[Sandia National Laboratories]] と [[Open Grid Computing]] が共同開発する HPC 監視・分析・フィードバックツール群 [[OVIS]] のデータ収集・転送・保存コンポーネント([[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]])。同一のマルチスレッド `ldmsd` デーモンをサンプラーモード・アグリゲータモードとして構成し、サンプラー・アグリゲータ・ストレージの3コンポーネントで構成する。TCP ソケット・InfiniBand/iWARP RDMA・Cray Gemini RDMA(ugni)の3種のトランスポートと、MySQL・フラットファイル・独自形式 Scalable Object Store(SOS)の複数ストレージ形式を動的に選択できる。
[[NCSA]] の [[Blue Waters]](27,648ノード)と [[Sandia National Laboratories]] の [[Chama]](1,296ノード)へ本番展開され、1秒間隔のサンプリングでもノード当たり2MB未満のメモリ・1%未満のCPUオーバーヘッドで、主要アプリケーション(Nalu, Adagio, CTH, MILC, LinkTest, MiniGhost, IMB)の実行時間に統計的に有意な影響を与えないことが実証された。Cray の `gpcdr` モジュールを介して Gemini 高速ネットワーク(HSN)の性能カウンタをユーザ空間へ公開する拡張を行い、この規模・忠実度での HSN 可視化を初めて実現した。(Source: [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]])
## 関連
- ソース: [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]] / [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]]
- 開発組織: [[Sandia National Laboratories]] / [[Open Grid Computing]]
- 展開先: [[NCSA]] の [[Blue Waters]] / [[Sandia National Laboratories]] の [[Chama]]
- 上位スイート: [[OVIS]]
- 比較対象: [[Ganglia]]
- 概念: [[分散モニタリング]] / [[階層型メトリック収集アーキテクチャ]]
- エンティティ: [[Perlmutter]] / [[NERSC]] / [[NVIDIA Data Center GPU Manager]]
- 展開・利用: [[Perlmutter]] / [[NERSC]]([[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]] で DCGM カウンタ収集経路)
## 出典
- [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]]