# LDMS Lightweight Distributed Metric Service。[[Sandia National Laboratories]] と [[Open Grid Computing]] が共同開発する HPC 監視・分析・フィードバックツール群 [[OVIS]] のデータ収集・転送・保存コンポーネント([[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]])。同一のマルチスレッド `ldmsd` デーモンをサンプラーモード・アグリゲータモードとして構成し、サンプラー・アグリゲータ・ストレージの3コンポーネントで構成する。TCP ソケット・InfiniBand/iWARP RDMA・Cray Gemini RDMA(ugni)の3種のトランスポートと、MySQL・フラットファイル・独自形式 Scalable Object Store(SOS)の複数ストレージ形式を動的に選択できる。 [[NCSA]] の [[Blue Waters]](27,648ノード)と [[Sandia National Laboratories]] の [[Chama]](1,296ノード)へ本番展開され、1秒間隔のサンプリングでもノード当たり2MB未満のメモリ・1%未満のCPUオーバーヘッドで、主要アプリケーション(Nalu, Adagio, CTH, MILC, LinkTest, MiniGhost, IMB)の実行時間に統計的に有意な影響を与えないことが実証された。Cray の `gpcdr` モジュールを介して Gemini 高速ネットワーク(HSN)の性能カウンタをユーザ空間へ公開する拡張を行い、この規模・忠実度での HSN 可視化を初めて実現した。(Source: [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]]) ## 関連 - ソース: [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]] / [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]] - 開発組織: [[Sandia National Laboratories]] / [[Open Grid Computing]] - 展開先: [[NCSA]] の [[Blue Waters]] / [[Sandia National Laboratories]] の [[Chama]] - 上位スイート: [[OVIS]] - 比較対象: [[Ganglia]] - 概念: [[分散モニタリング]] / [[階層型メトリック収集アーキテクチャ]] - エンティティ: [[Perlmutter]] / [[NERSC]] / [[NVIDIA Data Center GPU Manager]] - 展開・利用: [[Perlmutter]] / [[NERSC]]([[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]] で DCGM カウンタ収集経路) ## 出典 - [[@2014__SC14__The Lightweight Distributed Metric Service - A Scalable Infrastructure for Continuous Monitoring of Large Scale Computing Systems and Applications]]