# TPUv4 [[Google]] の Tensor Processing Unit(TPU)第3世代であり、機械学習訓練向けの exascale スーパーコンピュータとして 4096 ノードの 3D トーラス型カスタムインターコネクトを備える。前世代 TPUv3 が非再構成の固定 ICI(inter-chip interconnect)メッシュを持つ「静的 pod」であったのに対し、TPUv4 は [[Palomar Optical Circuit Switch]](OCS)によるキューブ単位の動的再構成性を核心とする([[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]])。 ## ハードウェア構成 - **キューブ(cube)**: 4x4x4 の 3D メッシュに配置された 64 個の TPUv4 チップからなるハードウェア単位。1 スーパーコンピュータ(pod)は 64 キューブ・合計 4096 TPU で構成される。 - 各 TPU マシンは CPU トレイと TPU トレイを PCIe で接続し、TPU トレイは 4 個の TPUv4 チップを 2x2x1 の ICI メッシュに配置。16 台の TPU マシンが 1 データセンターラック(=1 キューブ)を構成する。 - 各キューブは X/Y/Z 各次元 6 面に 16 本の光 ICI を露出(合計 96 リンク/キューブ)。**スーパーコンピュータ全体で 6,144 本の光 ICI リンクが 48 台の OCS に接続される。** - ICI リンクは 50GBps の単方向帯域幅を持ち、プログラマブルな4層プロトコルスタック(Physical/Data/Routing/Transaction)で構成される。ソフトウェアエージェントは Pod Manager・healthd・libtpunet・XLA。 - ツイストトーラストポロジ(4k, 4k, 8k)と(4k, 8k, 8k)の2ファミリーをサポート。 ## 運用実績(2020年〜本番稼働) - システム可用性 **99.98%**、訓練ジョブの約 **1%** がハードウェア停止の影響を受ける。 - 日次故障率: TPU マシン **0.08%**、ICI ケーブル **0.005%**、OCS **0.04%**。 - 訓練ジョブの **95%** が耐障害 ICI ルーティングをオプトイン。 - OCS・光ファイバのコストは pod 総資本コストの **5%未満**、稼働電力は pod 総電力の **3%未満**。 - 前世代 TPUv3 比で約 **2.1×** の性能。 ## 関連 - ソース: [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]] - エンティティ: [[Google]] / [[Palomar Optical Circuit Switch]] / [[Borg]] - 概念: [[光回線交換]] / [[AIデータセンタートポロジ]] / [[AIアクセラレータ]] / [[耐障害LLM訓練]] / [[フォールトトレランス]] / [[GPUクラスタ運用]] ## 出典 - [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]](§2 System Architecture, §5 Fleet Statistics)