# Rutgers University
米国ニュージャージー州の州立研究大学。電気・コンピュータ工学科の Zhao Zhang 研究室が GPU 性能モデリング・性能変動の分野で複数の論文を発表している。
- GPUPerf 論文では Rutgers 側の著者 2 名([[Mingkai Zheng]]・[[Zhao Zhang]])が参加し、メールアドレスのドメインは `rutgers.edu`。[[Case Western Reserve University]] と共同で、LLM 分散訓練の細粒度な GPU 性能モデリングを開発した。(Source: [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]])
- [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] では Rutgers 側の著者 4 名([[Michael Mogilevsky]]・[[Hazem Zaky]]・[[Mingkai Zheng]]・[[Zhao Zhang]])が参加し、[[George Mason University]] と共同で NVIDIA A100/GH200 の GPU 性能変動を特性化した。両論文はいずれも TACC の [[Vista]] と NERSC の [[Perlmutter]] を評価テストベッドに用いており、GPUPerf の性能予測誤差と本論文が実測する GPU ハードウェア変動が同じ現象の異なる側面である可能性がある([[GPU性能変動]]の横断的知見を参照)。
- 2004年には計算機科学科の[[Kiran Nagaraja]]・[[Fábio Oliveira]]・[[Ricardo Bianchini]]・[[Richard P. Martin]]・[[Thu D. Nguyen]]が[[@2004__OSDI__Understanding and Dealing with Operator Mistakes in Internet Services]](OSDI '04)を発表し、人間オペレータの運用ミスを実証的に特性化するとともに、オペレータのアクションを本番反映前に検証する validation 基盤を提案した。GPU クラスタ運用研究(2025〜2026年)とは20年以上の時間差があるが、いずれもインフラの信頼性・運用可観測性というテーマで一貫している。(Source: [[@2004__OSDI__Understanding and Dealing with Operator Mistakes in Internet Services]])
## 関連
- ソース: [[@2025__arXiv__Efficient Fine-Grained GPU Performance Modeling for Distributed Deep Learning of LLM]] / [[@2026__TPDS__Quantifying Performance Variability in GPU Clusters]] / [[@2004__OSDI__Understanding and Dealing with Operator Mistakes in Internet Services]]
- 所属研究者: [[Mingkai Zheng]] / [[Zhao Zhang]] / [[Michael Mogilevsky]] / [[Hazem Zaky]] / [[Kiran Nagaraja]] / [[Fábio Oliveira]] / [[Ricardo Bianchini]] / [[Richard P. Martin]] / [[Thu D. Nguyen]]
- 共同研究先: [[Case Western Reserve University]] / [[George Mason University]]
- 概念: [[LLM分散学習]] / [[並列化戦略]] / [[GPUクラスタ運用]] / [[GPU性能変動]] / [[運用障害分析]]