# SLURM SLURM(Simple Linux Utility for Resource Management)は、[[Lawrence Livermore National Laboratory]](LLNL)が Linux NetworX と共同開発した、数千ノード規模の Linux クラスタ向けオープンソース(GNU GPL)クラスタ管理・ジョブスケジューリングシステムである。各計算ノードで動くマルチスレッドデーモン slurmd、管理ノードで動く slurmctld(controller。フェイルオーバー用 backup を持てる)、および scancel/scontrol/sinfo/squeue/srun の5コマンドラインユーティリティで構成される。管理対象エンティティは nodes・partitions・jobs・job steps の4種。認証・インターコネクト・スケジューリングをプラガブルにする汎用プラグイン機構を持ち、デフォルトのジョブスケジューリングは単純な FIFO のみで、高度なポリシーは Maui Scheduler や DPCS のような外部スケジューラへプラグイン経由で委譲する設計である。2003年に LLNL の技術レポート(UCRL-MA-147996)として公開され、Yoo・Jette・Grondona の3名を著者として JSSPP 2003(LNCS 2862)で正式発表された。同年3月に LLNL の Linux クラスタで本番運用を開始し、1000ノード規模のベンチマークで Quadrics RMS と同等、IBM LoadLeveler の約80倍の性能を示した。(Source: [[@2003__JSSPP__SLURM - Simple Linux Utility for Resource Management]]) 以後 SLURM は HPC 業界で広く採用されるジョブスケジューラとなり、20年後の [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]] では Princeton 大学の10万コア・500GPU規模クラスタにおいて、Slurm のジョブデータベース(`AdminComment` 列)と Prometheus/Grafana を組み合わせた監視基盤 Jobstats の対象システムとして採用されている。(Source: [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]]) [[PIKA]]([[@2020__CLUSTER__PIKA - Center-Wide and Job-Aware Cluster Monitoring]])も SLURM をジョブメタデータの一次情報源として使う HPC ジョブモニタリングの例で、プロログ/エピログフェーズでの Job ID・開始/終了時刻の取得や、ノード共有時に必要な詳細資源割当情報が SLURM コントローラ上にしか無いという制約(追加クエリはコントローラ負荷増とのトレードオフ)を報告している。Jobstats が `AdminComment` フィールドへ長期要約を直接書き込むのに対し、PIKA は SLURM 内部データベースを都度クエリし、性能要約を独自のリレーショナルデータベースに保存する点で SLURM との統合方式が異なる。詳細は [[HPCジョブモニタリング]] を参照。 2026年3月の NVIDIA GTC 2026 では、開発元である [[SchedMD]] が [[NVIDIA]] 傘下に参入したことが発表された([[@2026__GTC__Orchestrate Next-Generation AI Workloads With Open-Source Slurm]])。Slurm と Kubernetes 統合ツールキット [[Slinky]] のオープンソース開発継続と GitHub 移行(PR/Issue の公開受付)が確約されている。技術面では、NVL72 などの超多層インターコネクト向けに `topology/block` プラグインと `topology.yaml` が整備され、大規模 AI 訓練(Hero jobs)のノード障害時に即時再スケジュールを行う Expedited Requeue(`SlurmctldParameters=enable_expedited_requeue`, `--requeue=expedite`)が導入された(Slurm 25.11)。また、可観測性の面では `slurmctld` からの OpenMetrics (Prometheus) 直接出力や、ジョブ再試行時にも一意性が保証される辞書順ソート可能識別子 `SLUID` が導入され、2026年5月(26.05)および11月(26.11 での `topology/ring`, `topology/torus3d`)のロードマップが示されている。 ## 関連 - 開発元・著者: [[Lawrence Livermore National Laboratory]] / [[Morris Jette]] / [[Mark Grondona]] / [[Andy B. Yoo]] / [[SchedMD]] / [[NVIDIA]] / [[Tim Wickberg]] / [[Danny Auble]] - 応用事例: [[@2023__PEARC__Jobstats - A Slurm-Compatible Job Monitoring Platform for CPU and GPU Clusters]] - 概念: [[HPCジョブスケジューリング]] / [[パイロットジョブ]] / [[トポロジ考慮型スケジューリング]] / [[GPUクラスタスケジューリング]] - ソース: [[@2020__CLUSTER__PIKA - Center-Wide and Job-Aware Cluster Monitoring]] / [[@2026__ISSRE__SLoFI : Low-Privilege Fault Injection for Reliability Testing in Production Supercomputers]] / [[@2026__arXiv__Balancing Workload Performance and Slurm Stress - Four Nextflow Deployment Strategies]] / [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]] / [[@2026__GTC__Orchestrate Next-Generation AI Workloads With Open-Source Slurm]] - エンティティ: [[PIKA]] / [[Nextflow]] / [[HyperQueue]] / [[Flux Framework]] / [[Slinky]] / [[NVIDIA]] - 計測事例: [[@2026__arXiv__Balancing Workload Performance and Slurm Stress - Four Nextflow Deployment Strategies]](Nextflow 配備 4 戦略の clean-start ウォールタイムとユーザー別 sdiag RPC) - 計測事例: [[@2026__IPDPS__Characterizing Production GPU Workloads using System-wide Telemetry Data]](sacct ジョブメタデータと LDMS サンプルの突合) ## 出典 - [[@2026__arXiv__Balancing Workload Performance and Slurm Stress - Four Nextflow Deployment Strategies]](sdiag ユーザー別 RPC・ジョブ配列・Fairshare 文脈での WMS 配備比較)