# TPUv4
[[Google]] の Tensor Processing Unit(TPU)第3世代であり、機械学習訓練向けの exascale スーパーコンピュータとして 4096 ノードの 3D トーラス型カスタムインターコネクトを備える。前世代 TPUv3 が非再構成の固定 ICI(inter-chip interconnect)メッシュを持つ「静的 pod」であったのに対し、TPUv4 は [[Palomar Optical Circuit Switch]](OCS)によるキューブ単位の動的再構成性を核心とする([[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]])。
## ハードウェア構成
- **キューブ(cube)**: 4x4x4 の 3D メッシュに配置された 64 個の TPUv4 チップからなるハードウェア単位。1 スーパーコンピュータ(pod)は 64 キューブ・合計 4096 TPU で構成される。
- 各 TPU マシンは CPU トレイと TPU トレイを PCIe で接続し、TPU トレイは 4 個の TPUv4 チップを 2x2x1 の ICI メッシュに配置。16 台の TPU マシンが 1 データセンターラック(=1 キューブ)を構成する。
- 各キューブは X/Y/Z 各次元 6 面に 16 本の光 ICI を露出(合計 96 リンク/キューブ)。**スーパーコンピュータ全体で 6,144 本の光 ICI リンクが 48 台の OCS に接続される。**
- ICI リンクは 50GBps の単方向帯域幅を持ち、プログラマブルな4層プロトコルスタック(Physical/Data/Routing/Transaction)で構成される。ソフトウェアエージェントは Pod Manager・healthd・libtpunet・XLA。
- ツイストトーラストポロジ(4k, 4k, 8k)と(4k, 8k, 8k)の2ファミリーをサポート。
## 運用実績(2020年〜本番稼働)
- システム可用性 **99.98%**、訓練ジョブの約 **1%** がハードウェア停止の影響を受ける。
- 日次故障率: TPU マシン **0.08%**、ICI ケーブル **0.005%**、OCS **0.04%**。
- 訓練ジョブの **95%** が耐障害 ICI ルーティングをオプトイン。
- OCS・光ファイバのコストは pod 総資本コストの **5%未満**、稼働電力は pod 総電力の **3%未満**。
- 前世代 TPUv3 比で約 **2.1×** の性能。
## 関連
- ソース: [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]]
- エンティティ: [[Google]] / [[Palomar Optical Circuit Switch]] / [[Borg]]
- 概念: [[光回線交換]] / [[AIデータセンタートポロジ]] / [[AIアクセラレータ]] / [[耐障害LLM訓練]] / [[フォールトトレランス]] / [[GPUクラスタ運用]]
## 出典
- [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]](§2 System Architecture, §5 Fleet Statistics)