# 3D-DRAM
## 定義
ロジックダイと DRAM ダイを垂直方向(3D)に積層し、DRAM 上または DRAM に隣接してコンピュートを配置する「compute-on-memory」アーキテクチャ。SRAM(高帯域・低容量・オンダイ)と HBM(高容量・2.5D パッケージ・beachfront 制約により帯域拡張が困難)の中間に位置し、短い垂直 I/O(mm スケール)により PHY レス・beachfront 制約なしで SRAM 級の帯域を HBM の約 1/10 のエネルギー/bit で実現することを狙う。ロジックとDRAMの積層順序には「DRAM on top」(熱課題: アクセラレータの熱が温度に敏感な DRAM スタックを通過して逃げる必要がある)と「Logic on top」(電力供給課題: 数百 W が TSV を通って DRAM スタックへ供給されるため IR drop が生じる)の 2 方式があり、電力密度 ≤0.5W/mm² の 1-Hi スタック・Logic-on-Top構成であれば液冷により DRAM を 100℃未満に保てる。
## 3D-DRAM 統合の 3 つの課題(Raptor の事例)
d-Matrix の 3D-DRAM アクセラレータ Raptor(TSMC N4 ロジックダイ + 3D DRAM ダイ、36μ Face-to-Face スタッキング)は、Hardware / Architecture / Co-Design の 3 層にまたがる統合課題のうち、以下の 3 つが互いに設計空間を制約し合う(entangled)ことを報告する。
- **Bank-to-channel mapping 問題**: Tensor Engine が要求する 128B フリット(4×32B)に対し、DRAM 側の物理制約(840 バンク/ダイ、72 スペア差し引き後 768 バンク、256 チャネル/チップレット)では 1 チャネルあたり 3 バンク(96B)しか割り当てられず、素朴な実装では 128B フリットのために 2 回アクセス(192B)を要し 33% のオーバーフェッチ(≈33TB/s の浪費)が生じる。解決策「Stream Blocking」は、4 番目の 32B(部分アクセス)を 3 つの連続フリットで共有する 1 回のアクセスに割り当てることで、192B ではなく 96B×4=384B の入力から 128B×3=384B を過不足なく出力し、シフトバッファなしでオーバーフェッチを 0% にする。
- **I/O power wall**: 100TB/s の転送は 0.37pJ/bit で 296W に達する。従来の DBI(Data Bus Inversion、切り替えビット数を減らして I/O 電力を~20%削減する技術)は HBM/DDR のマルチサイクルバースト(BL 4〜16)を前提にサイドバンドピンで反転有無を伝えるが、3D-DRAM の単一サイクル 256bit 転送にはバーストもサイドバンドピンも無い。解決策「Stream Flipping(pinless DBI)」は、各フリットを直前のフリットと比較して反転するかどうかを ECC と同じ位置に co-locate した 1 ビットのメタデータタグとして持たせることで、専用ピンや PHY 変更なしに 0.8% のオーバーヘッドで 20% の I/O 電力削減を達成する。
- **サーマルリライアビリティ**: ロジックダイの接合温度 Tj が最大 105℃ に達し、DRAM のリテンションが標準の 32ms(85℃)から 4ms へ低下する(8倍の頻度のリフレッシュが必要)。加えて (1) 840 バンク/ダイでは 1% の故障率でもチャネル丸ごと喪失のリスクがあり、ボンディング済みダイの廃棄は非経済的(歩留まり問題)、(2) 故障バンクの単純無効化はチャネル幅を狭め Tensor Engine が要求する均一チャネル幅を崩す(対称性問題)、(3) 高 Tj はソフトエラーを増やし ECC・scrub・リフレッシュの共存が要る(エラー蓄積)、という 3 つの問題が複合する。解決策は 2 つ: (a) 「深いバンキング」— 商用 DRAM の~32K 行に対し Raptor は 1,366 行と 16〜32 倍少なく、8 倍頻度のリフレッシュでも帯域損失を <1.4%(~100TB/s 中)に抑えられる。ECC は 124 列中の最後 8 列に [132,128] Reed–Solomon + DBI ビットとして interleave する。(b) 「Bank Chaining」— 72 個のインライン冗長 μbank を M=2 段の物理マルチプレクサでチェーン配線し、Level 1 が最初の故障、Level 2 が 2 番目の故障をスキップすることで、チャネルのどこで発生した障害でも対称性を保ったまま任意 2 箇所を吸収する。
## 3D-DRAM vs SRAM vs HBM
| 指標 | SRAM(Corsair) | HBM4 | 3D-DRAM(Raptor) |
|---|---|---|---|
| 帯域/card | 300TB/s | 実効上限~20TB/s | 100+TB/s |
| 容量/card | ~4GB | 192GB | 32GB |
| I/O エネルギー | ~0.5pJ/bit | 2〜3pJ/bit | 0.37pJ/bit |
| トポロジ | オンダイ | 2.5D(横に配置、beachfront 制約) | F2F(下に積層) |
3D-DRAM はダイ層数が少なく済む(≤4 層 vs HBM の 12〜16 層)ため歩留まりで有利。silicon-area 基準では Raptor 3D-DRAM は帯域/mm² で HBM4 比 ~20 倍、GB/s あたり電力で ~13.5 倍優れると報告される。
## 未編纂の観察
- [Raptor 事例] 3D-DRAM 特有の 3 課題(バンク-チャネル対応、I/O 電力、サーマル)は互いに独立でなく、一方の解(冗長性によるチャネルトポロジ変更、データレイアウトによるビット遷移パターン変化)が他方の設計空間を制約する。単一のコンパクトなチップレット上で複数の物理制約(TSV 密度、電力供給、信号整合性)とアーキテクチャ選択(バンクマッピング、冗長性、リフレッシュスケジューリング)が密結合するという知見は、他の 3D 積層(3D V-Cache 等、[[チップレット]])の co-design にも一般化しうる可能性がある。
- [シリコン評価] Hot Chips 2026 講演の要約発表に対応する ISCA 2026 本審査論文(Nair+, ISCA2026)は、シリコン実測値で主張を裏付ける。Stream Flipping(pin レス DBI)は I/O エネルギーを 18% 削減(8 バンクで 0.455→0.376pJ/bit、実効スイッチング率 40〜48%)、700MHz で 105TB/s 帯域・2.5ns フリット遅延を達成し、Tj=105°C 環境でも深いバンキング(1364 行/バンク、従来 DRAM の 16〜32 分の 1)により 4ms リフレッシュのオーバーヘッドは 1.37% に留まる。F2F ボンディングによる「熱の逆転」(3D-DRAM 層がロジックより約 3.5°C 低い)は、Logic-on-Top 方式が通常の HBM 構成(DRAM がロジックの熱を吸収)と逆転する点を定量的に示す。(Source: [[@2026__ISCA__Early Silicon of Raptor - The First 3D-DRAM Accelerator for Generative Inference]])
- [一般化可能性] ISCA 論文は Hot Chips スライドと同一プロダクト(Raptor)の詳細版であり、依然として単一実装からの知見に留まる。バンクチェイニング型トポロジ保存冗長性(N=24, M=2 で最大 2 個の任意位置故障を許容)は概念としては一般的だが、定量評価(帯域断崖の回避幅、H2-LLM 比約 250 倍・Stratum 比 3.3〜10 倍の帯域優位)は Raptor 固有の 840 バンク・100TB/s 構成に基づくため、既存の未解決の問い(他社 3D-DRAM 実装への一般化可能性)は未解決のまま。
## 未解決の問い
- Raptor の Stream Blocking / Stream Flipping / Bank Chaining は、この特定のチップレット構成(840 バンク、16ch×16TE-Group、128B フリット)に特化した数値解であり、異なるバンク数・フリットサイズを持つ他社 3D-DRAM 設計にどこまで一般化できるかは、他の実装例(2 文書以上)が ingest されるまで判断できない。
- Logic-on-Top 方式の電力供給(IR drop)課題と DRAM-on-Top 方式の熱課題(本講演では前者を採用)のトレードオフが、多層スタッキング(1-Hi を超える multi-high、ロードマップ上は hybrid bonding で <2μm ピッチ・8-high)でどう変化するかは本講演で扱われていない(p.10 "NOT COVERED" の workload mapping と合わせて今後の課題)。
## 関連
- [[メモリウォール]] — SRAM/HBM/3D-DRAM のエネルギー/bit 比較は帯域-レイテンシ-電力トレードオフの具体例。
- [[チップレット]] — F2F(Face-to-Face)スタッキングによるダイ統合技術としての位置づけ。
- [[LLM推論]] — Decode フェーズのメモリ帯域律速を解消する具体的ハードウェア解。
- [[Mixture-of-Experts]] — MoE の memory-bandwidth-bound な decode を下支えする候補技術。
- [[d-Matrix]] — Raptor(3D-DRAM)と Corsair(SRAM)の開発元。
## 出典
- [[@2026__HotChips2026__Raptor - The First 3D-DRAM Accelerator for Generative Inference]]