# MPI Operator Kubeflow プロジェクトに端を発する Kubernetes Operator で、「MPIJob」というカスタムリソースを定義する。[[@2023__arXiv__The Flux Operator]] の実験時点(2023年)で、Kubernetes 上で MPI ワークロードを実行する主要な選択肢とされていた。ワーカー間の協調は SSH で行われ、Flux Operator のリードブローカーとは異なり、協調専用の追加ランチャーノードを常に必要とする設計上の違いがある(この追加ノードのコストは Flux Operator には発生しない)。(Source: [[@2023__arXiv__The Flux Operator]] §4.1 Methods) - [[@2023__arXiv__The Flux Operator]] の LAMMPS 強スケーリング実験では、100 MPI ランク超へスケールできるよう改変された版([22])が用いられ、Flux Operator と比較して総壁時間で平均約5%、ランチャー時間(mpirun vs flux submit)でもやや大きな差で劣後する結果が報告された。(Source: [[@2023__arXiv__The Flux Operator]] §4.2 Results) - MPI Operator の設計では、クラスタ作成・削除時間に対応する明確な指標が Flux Operator のように定義できず、[[@2023__arXiv__The Flux Operator]] はこの点で両者を直接比較できないと明示している。(Source: [[@2023__arXiv__The Flux Operator]] §4.2 Results) ## 関連 - 本ソース: [[@2023__arXiv__The Flux Operator]] - 関連システム: [[Kubernetes]] / [[Flux Framework]]