# NVIDIA Pascal NVIDIA GPUのマイクロアーキテクチャ世代の一つ(2016年)。サーバ/デスクトップ向けの**Tesla P100**(チップ名GP100)と、自動車・組み込み向けの**Tegra Parker**を含む。`Computer Architecture: A Quantitative Approach`第6版第4章は、GPUアーキテクチャ全体の説明にPascal P100を主要な実例として用いる(Source: [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 4 Data-Level Parallelism in Vector, SIMD, and GPU Architectures]] §4.4)。 ## 主要スペック(Tesla P100 / GP100) - 56個のmultithreaded SIMD Processor、1プロセッサあたり64 SIMDレーン(32レーン×2組) - 単精度浮動小数点ピーク性能 10 TeraFLOP/s、倍精度 5 TeraFLOP/s(従来世代は倍精度が単精度の1/8速度だったのに対し1/2速度まで改善)、半精度 20 TeraFLOP/s - HBM2(高帯域幅メモリ)、4096データ線、ピーク帯域幅732 GB/s - NVLink(チップ間相互接続)、1チップあたり4チャンネルで合計160 GB/sのピーク帯域幅。IBM Power9 CPUとのコヒーレントメモリ共有にも対応 - 統一仮想メモリとページフォールト対応(demand paging) - 15.3億トランジスタ、TSMC 16nm FinFETプロセス、ダイサイズ約645 mm²、消費電力300W - 1つのSIMD Processorが2基のSIMD Thread Scheduler(デュアルスケジューラ)を持ち、毎クロック2つのWarpから1命令ずつ発行 (Source: [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 4 Data-Level Parallelism in Vector, SIMD, and GPU Architectures]] §4.4, §4.7) ## GPUアーキテクチャの説明における位置づけ 同章はGPUを「グラフィクス由来の独自語彙を持つ、多数レーンの浅いマルチスレッド化ベクトルプロセッサ」として解説する枠組みの中心にPascalを据え、Grid/Thread Block/Warpのマッピング(図4.13)、multithreaded SIMD Processorのブロック図(図4.14、図4.20)、チップ全体のフロアプラン(図4.15)のいずれもPascal P100の構成を題材とする。同章はまた、Pascal(P100)と旧世代GTX 280、および同時代のIntel Xeon Platinum 8180とのRooflineモデル比較・実測ベンチマーク比較にもPascalを用いる。 ## 関連 - ソース: [[@2019__MorganKaufmann__Computer Architecture - A Quantitative Approach - Chapter 4 Data-Level Parallelism in Vector, SIMD, and GPU Architectures]] - エンティティ: [[NVIDIA]] / [[CUDA]] / [[PTX]] ## 出典 - John L. Hennessy, David A. Patterson, *Computer Architecture: A Quantitative Approach*, Sixth Edition, Morgan Kaufmann, 2019, Chapter 4, §4.4, §4.7.