# Oak Ridge National Laboratory 米国エネルギー省(DOE)が所管する国立研究所(ORNL)。スパコン [[Summit]] を運用し、その冷却・電力インフラの長期テレメトリを保有する。(Source: [[@2025__ISAV__From Exploration to Explanation - ML-Driven Causal Discovery for Datacenter Reliability at Scale]]) - ISAV 2025 の [[PACE]] 論文では ORNL 側の Wesley Brewer が著者に連なり、[[Hewlett Packard Labs]] との共同研究として行われた。 - PACE の評価データは ORNL の [[Summit]] スパコンの冷却インフラの 7 年分のテレメトリ(Yokogawa SMARTDAC 監視システムで収集)で、冷却塔の入口・出口温度、ポンプ流量、チラー状態、熱交換器性能など数十〜数百の相互依存する施設メトリクスを含む。 NSDI 2022([[@2022__NSDI__Accelerating Collective Communication in Data Parallel Training across Deep Learning Frameworks]])では、Junqi Yin・Nouamane Laanait・Bing Xie・M. Todd Young・Vitalii Starchenko・Albina Borisevich・Michael Matheson らが著者として [[NVIDIA]] の [[Joshua Romero]]・Sean Treichler と共同で [[Horovod]] の集団通信を改善し、[[Summit]] 全体(27,600 GPU)を使った大規模実験でスケーリング効率 0.93 と 1.54 エクサフロップス(FP16 持続)を達成した。実験には INCITE プログラムの計算時間が使われた。 ORNL の Oak Ridge Leadership Computing Facility(OLCF)は米国初のエクサスケールスパコン [[Frontier]] を運用しており、そのセンターワイド並列ファイルシステムとして約 700 PB の [[Lustre]] ベースファイルシステム [[Orion]] を導入している。Lustre Unveiled 論文では ORNL NCCS の [[Anjus George]]、[[Sarp Oral]] ら 10 名が著者に連なり、Orion の設計・性能データを詳細に報告した。(Source: [[@2025__TOS__Lustre Unveiled - Chapter 6 Lustre in Practice - Frontier's Orion]]) また、IEEE BigData 2017([[@2017__IEEE BigData__I O Load Balancing for Big Data HPC Applications]])では、ORNL の Feiyi Wang、[[Sarp Oral]]、Michael J. Brim らが [[Virginia Tech]] の [[Arnab K. Paul]]、[[Ali R. Butt]] らと共同で、Lustre におけるビッグデータアプリケーション向けのデータ駆動型 I/O 負荷分散(MCMF 法)を提案し、Titan 等の実機運用を踏まえた評価を実施した。 GPUインターコネクト評価論文([[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]])では、著者の一人 [[Jieyang Chen]](CSM Division postdoc)がORNLに所属し、評価プラットフォームの SummitDev・Summit(いずれも [[Summit]] の前身/後継スパコン)を提供した。(Source: [[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]]) ## 関連 - ソース: [[@2025__ISAV__From Exploration to Explanation - ML-Driven Causal Discovery for Datacenter Reliability at Scale]] / [[@2025__TOS__Lustre Unveiled - Chapter 6 Lustre in Practice - Frontier's Orion]] / [[@2022__NSDI__Accelerating Collective Communication in Data Parallel Training across Deep Learning Frameworks]] / [[@2020__TPDS__Evaluating Modern GPU Interconnect - PCIe, NVLink, NV-SLI, NVSwitch and GPUDirect]] / [[@2017__IEEE BigData__I O Load Balancing for Big Data HPC Applications]] / [[@2025__arXiv__Scaling up Test-Time Compute with Latent Reasoning - A Recurrent Depth Approach]] - 所属研究者: [[Wesley Brewer]] / [[Anjus George]] / [[Sarp Oral]] / [[Jieyang Chen]] - 共同研究先: [[Hewlett Packard Labs]] / [[Virginia Tech]] - 関連プロダクト: [[Summit]] / [[PACE]] / [[Frontier]] / [[Orion]] / [[Lustre]] - 概念: [[根本原因分析]] / [[テレメトリ]]