# データ移動エネルギー
## 定義
データ移動エネルギーとは、演算そのものではなく、データをチップ内・パッケージ間・ラック間・メモリ階層の各段で動かし格納するために要するエネルギーである。2008 年の DARPA 研究は、エクサスケールの電力課題の中心が演算器ではこの移動側にあるとした。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 1 Executive Overview]], [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]])
## 電力配分の支配項
- **エクサスケールの電力の中心は演算器ではなくデータ移動にある。**
- 根拠: 第 7 章の総括は、実際のエネルギー(電力)の課題は効率的な FPU よりも低エネルギーのデータ輸送にあり、FPU は面積・コスト・電力の面で最も安価な資源の 1 つだと述べる。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]])
- 根拠: 第 1 章は、基礎演算の電力問題よりデータ移動と階層メモリへの格納の電力問題の方が解きにくいかもしれないとする。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 1 Executive Overview]])
- 根拠: 第 8 章は、データ転送のエネルギーが将来は計算部分を圧倒し、過去 20 年の改善傾向を維持できても 2015 年の電力は 10〜100 倍届かないとする。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 8 Exascale Challenges and Key Research Areas]])
- **積極設計ストローマン(1 Eflops で 67.7 MW)の電力配分では、FPU は最小の項の 1 つである。**
- 根拠: システム全体で FPU 17%・メモリ 31%・インターコネクト 27%・リーク 25%(図 7.20 の読み取り)。メモリ電力の約 2/3 はレジスタファイルと L1 が占め、インターコネクト電力の大半はラック間転送である。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]])
- 根拠: FPU 単体は 10.6 pJ/op だが、L1 までを含むコアでは 23.3 pJ/op と 2 倍以上になる。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]])
- 留保: この電力見積もりは ECC・タグ・クロック配信・冗長化・RAID を含まない best case である。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]])
- **移動の単位エネルギーは経路の種別で桁が違い、低振幅化と短距離化が主な緩和手段になる。**
- 根拠: オンチップは 110 fJ/bit-mm、低振幅(0.1 V 振幅)で 18 fJ/bit-mm。オフチップは市販で 30 pJ/bit、研究段階で 2 pJ/bit。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 6 Technology Roadmaps]])
- 根拠: 第 8 章は 1 レベルあたり 1 ビットの移動を 1〜3 pJ とし、1 EB/s を要する経路 1 段で電力は 10〜30 MW になると見積もる。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 8 Exascale Challenges and Key Research Areas]])
- 留保: 低振幅シグナリングの数値は第 6 章・第 7 章が 18 fJ/bit-mm、第 8 章が約 6 fJ/mm(従来の全振幅は約 0.5 pJ/mm)と記し、原文どおり章ごとに異なる。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]], [[@2008__DARPA__ExaScale Computing Study - Chapter 8 Exascale Challenges and Key Research Areas]])
## アプリケーション側の移動負荷
- **メモリ集約コードでは時間の大半がデータ移動に費やされ、演算器を速くしても効かない。**
- 根拠: Cray XMP は時間の約 50% をデータ移動に費やすのに対し、BG/L は 99% に達しうる。WRF の時間内訳は主記憶 30%、L1 30%、L2 12%、易しい flops 19%。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 5 Exascale Application Characteristics]])
- 関連: 主記憶遅延の側からの整理は [[メモリウォール]] を参照する。
## 未解決の問い
- 低振幅シグナリングの 18 fJ/bit-mm(第 6・7 章)と約 6 fJ/mm(第 8 章)の差は、条件の違いか見積もりの違いか。
- 光デバイスの結論は、直列化・光源の固定費・ルータ切替・温度制御を含む bit あたりエネルギーを電気の高度な方式と全システムで比べるまで出せない。この比較は [[フォトニックインターコネクト]] でどこまで進んだか。
- DRAM をエネルギー効率の高い形に再設計することは技術的に可能でも、コスト重視の商用市場が自発的には起こさないとされる。誰がその再設計を担うのか。
## 未編纂の観察
- 演算より移動が高いという 2008 年の命題は、[[メモリウォール]] にある 2026 年の AI 推論の議論(KV キャッシュの読み書きが支配)と同じ向きにある。ただし前者は電力、後者は帯域と容量の律速であり、同じ現象とは限らない。(Source: [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]])
## 関連
- [[メモリウォール]]、[[エクサスケール]]、[[フォトニックインターコネクト]]、[[メモリ階層とキャッシュ]]、[[局所性]]
- ハブ: [[ExaScale Computing Study - Technology Challenges in Achieving Exascale Systems]]
- MOC: [[HPC - MOC]]
## 出典
- [[@2008__DARPA__ExaScale Computing Study - Chapter 1 Executive Overview]](データ移動の電力が基礎演算より難しいとする主張)
- [[@2008__DARPA__ExaScale Computing Study - Chapter 5 Exascale Application Characteristics]](移動時間の割合)
- [[@2008__DARPA__ExaScale Computing Study - Chapter 6 Technology Roadmaps]](経路別の pJ/bit)
- [[@2008__DARPA__ExaScale Computing Study - Chapter 7 Strawmen - Where Evolution Is and Is Not Enough]](電力配分)
- [[@2008__DARPA__ExaScale Computing Study - Chapter 8 Exascale Challenges and Key Research Areas]](1 EB/s あたり 10〜30 MW)