# ウェーハスケールエンジン ## 定義 ウェーハスケールエンジン(Wafer Scale Engine; WSE)とは、半導体製造用のシリコンウェーハ全体(直径約300mm)を個別のダイに切断(ダイシング)せず、単一の超巨大プロセッサチップとして製造・集積する計算機アーキテクチャである。Cerebras Systems が実用化し、第3世代(CS-3 / WSE-3)では1枚のウェーハ上に90万個のコアと44GBの大容量オンチップSRAMを集積している。(Source: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]], [[AI Chip Architectures]]) ## アーキテクチャ構成と物理的優位性 - **スクライブライン上の配線接続によりチップ間境界のボトルネックを解消する**: 従来の半導体ではダイ境界で切断されるスクライブライン(露光境界)上に高層金属配線を敷設し、ウェーハ全面にわたる2次元メッシュネットワークを形成する。これにより、ダイ間インターポーザや基板配線に伴う帯域低下とレイテンシ増大を排除している。 - **微小欠陥への高密度冗長性による高歩留まりの維持**: 巨大チップにおける製造欠陥に対し、~0.05mm²の極小コア単位で無効化とバイパス経路の再構成を行うとともに、約7%の予備コアプールを備えることで、ウェーハスケールでの実用歩留まりを達成している。 - **オンチップSRAMと超広帯域NoCの統合**: 各処理要素(PE)に局所SRAM(数十KB)と5方向ルータを直接配置し、隣接コア間を2ナノ秒未満の極小遅延かつ毎秒ペタバイト級の総帯域で接続する。 ## クラスタスケーリングと遅延隠蔽 - **オフウェーハI/Oと外部スイッチトポロジ**: ウェーハ外周の専用I/Oタイル(CS-3では左右各66個、計132タイル)から100Gbpsポート群を介して外部Ethernetスイッチアレイに接続する。ウェーハ間の物理配線対称性を吸収するため、チェッカーボード状の鏡像配置トポロジが採用される。 - **データフロー領域平行移動によるネットワーク遅延の無効化**: オフウェーハ通信に伴う約10μsのEthernet遅延に対し、格子の空間・時間マッピングを毎ステップ平行移動させることで、ノード間通信を単方向パイプライン化し、クラスタ全体を単一の巨大データフローファブリックとして計算バウンド領域で動作させることができる。 ## 未解決の問い - WSEクラスタにおける電力供給(1ノード約23kW)と冷却制約下で、1.2GHz超の最大クロック動作を維持するための動的電力管理と局所スロットリング回避策はどこまで自動化可能か。 - 単一ウェーハ内での超高効率データフロー実行に対し、マルチウェーハクラスタへの自動コンパイル・パーティショニングツールチェーンの汎用性はどの程度確立できるか。 ## 未編纂の観察 - **64台のCS-3クラスタ(5,760万コア)において、完全弱スケーリングと112 PFLOPS(電力制約下84.7 PFLOPS・57 GFLOP/J)を達成**: WSEクラスタ上で領域平行移動アルゴリズムを実装することで、熱伝導方程式および地球規模津波浅水方程式において、ノード間通信遅延を完全に隠蔽し、ピーク比57%〜88%という従来のスーパーコンピュータを大幅に凌駕するステンシル実効性能を実証した。(Source: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]]) ## 関連 - ソース: [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]] - 概念: [[データフローアーキテクチャ]], [[AIアクセラレータ]], [[エクサスケール]], [[ドメイン固有アーキテクチャ]] - エンティティ: [[Cerebras]] ## 出典 - [[@2026__HPCAsia__Beyond Exascale - Dataflow Domain Translation on a Cerebras Cluster]](WSEの構造、CS-3クラスタトポロジ、オフウェーハルーティング設計) - [[AI Chip Architectures]](Cerebras WSEの製造工程、歩留まり設計、SRAMアーキテクチャ)