# PIKA PIKA は [[TU Dresden]] Center for Information Services and High Performance Computing (ZIH) が開発した、center-wide(センター全体)かつ job-aware(ジョブ単位を意識した)HPC クラスタモニタリングのソフトウェアスタックである([[@2020__CLUSTER__PIKA - Center-Wide and Job-Aware Cluster Monitoring]])。約1,800ノード・71,000コアの Taurus システムで本番稼働しており、収集(Collection)・保存(Storage)・分析(Analysis)・可視化(Visualization)の4層アーキテクチャを持つ。 収集層は[[collectd]]ベースのノードローカルなジョブ非依存(job-agnostic)データ収集デーモンで、CPU・メモリ・[[LIKWID]]経由のハードウェアカウンタ(IPC・FLOPS・メモリ帯域・電力)・InfiniBand/Ethernet帯域・ローカルディスクおよびLustreのI/O・GPU(NVML)を収集する。保存層は短期・長期の2段構成の[[InfluxDB]](時系列データ)とMariaDB/MySQL/PostgreSQL(ジョブメタデータ、[[SLURM]]から取得)からなる。分析層はパフォーマンスフットプリント(メトリクスの平均・最小・最大値要約)を生成し、しきい値ベースで unrestrained / memory-bound / compute-bound / GPU-bound / IO-heavy / network-heavy の6種にジョブを自動タグ付けする。可視化層はAngular+PHPのWebフロントエンドで、テーブルビュー・ヒストグラム/散布図によるフットプリントビュー・タイムラインビューを提供する。 2021年のSC21 Analyzing Parallel I/O BoFでのフォローアップ発表「I/O Aspects in the Center-Wide and Job-Aware Cluster Monitoring System PIKA」では、収集デーモンのサンプリング間隔(CPUカウンタ60秒・他30秒、いずれも調整可能)や、複数ジョブ間のLustre読み書きサイズ比較・全ジョブ横断の読み書き分布散布図といった、論文本文には無いI/O特化の追加可視化機能が示された。ソフトウェアは https://gitlab.hrz.tu-chemnitz.de/pika で公開されている。 ## 関連 - ソース: [[@2020__CLUSTER__PIKA - Center-Wide and Job-Aware Cluster Monitoring]] - 開発元: [[TU Dresden]] - 構成技術: [[collectd]] / [[LIKWID]] / [[InfluxDB]] / [[SLURM]] - 関連概念: [[HPCジョブモニタリング]]