# データフローアーキテクチャ
## 定義
データフローアーキテクチャ(Dataflow Architecture)とは、命令ポインタ(プログラムカウンタ)の逐次進行によって実行を制御するフォン・ノイマン型アーキテクチャとは異なり、入力データの到着や依存関係の充足によって演算を発火させる計算機アーキテクチャである。多数の処理要素(Processing Element; PE)が格子状に配列され、オンチップネットワーク(NoC)を介して局所的に接続される空間アーキテクチャ(Spatial Architecture)として実装されることが多く、物理学の「局所性の原理」に合致した実行特性を持つ。(Source: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]])
## 空間アーキテクチャと物理局所性
- **プロセッサとメモリの完全分散配置によりメモリ階層のボトルネックを排除する**: 階層型キャッシュ構造を持つ共有メモリ型プロセッサとは異なり、各処理要素が局所SRAMとルータを備え、フラットなトポロジを構成する。これによりメモリ帯域幅がプロセッサ演算速度と完全に釣り合い、外部メモリアクセスに伴うレイテンシとエネルギー消費が最小化される。
- **近接ルータ間の非同期・自律的データ転送がグローバル同期を不要にする**: 処理要素間の通信はNoC上の固定ネイバー間で行われ、波束(wavelet)などの軽量メッセージとして低遅延(数ナノ秒以下)で中継される。中央制御やホストプロセッサとの頻繁な同期を必要とせず、コンパイル時に決定されたデータフローに従って自己調整的に実行が進む。
## 通信遅延の完全隠蔽メカニズム
- **時空図の平行移動によりノード間通信遅延を計算で隠蔽する**: ステンシル計算などの空間格子計算において、計算平面を時空軸上で斜め(45度)に傾け、格子のマッピングを毎ステップ平行移動させる「領域平行移動(Domain Translation)」を適用することで、ノード間リンクを単方向トラフィック化し、累積的な遅延蓄積を排除して計算バウンドな超高並列実行を実現できる。
- **データ移動を空間1ホップ・時間2ホップ以内に拘束する**: 相対論的な光円錐(Penrose図)に類似した設計により、任意の実行時点における「現在」のデータがプロセッサの局所近傍に常駐し続け、長距離通信のオーバーヘッドを発生させない。
## 未解決の問い
- データフロー空間アーキテクチャにおいて、非構造格子や不規則スパース行列計算に対して領域平行移動のような完全遅延隠蔽アルゴリズムをどの程度一般化できるか。
- ウェーハ規模を超える超大規模クラスタにおいて、ネットワークパケット損失やハードウェア障害が発生した際の局所的な自己修復・耐障害性データフローモデルはどう設計されるべきか。
## 未編纂の観察
- **Cerebras CS-3 クラスタでの実証により、データフローアーキテクチャがステンシル計算においてピーク比88%という前例のない利用率を達成した**: フォン・ノイマン型クラスタではメモリウォールとネットワーク遅延によりピーク比5%未満に停滞していたステンシル計算に対し、空間データフロー設計と領域平行移動アルゴリズムを融合することで、10μsのネットワーク遅延を完全に隠蔽し、毎秒160万タイムステップ超の強スケーリングを実現した。(Source: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]])
## 関連
- ソース: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]]
- 概念: [[ウェーハスケールエンジン]], [[AIアクセラレータ]], [[ドメイン固有アーキテクチャ]], [[メモリウォール]]
- エンティティ: [[Cerebras]], [[SambaNova]], [[Groq]]
## 出典
- [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]](空間データフローアーキテクチャの定義、物理局所性原理との対応、領域平行移動アルゴリズムの実装)