# PyTorch [[Meta]] が主導するオープンソース深層学習フレームワーク。[[FT-HSDP]]([[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]])は、復旧プロセスの「その他ロードオーバーヘッド」の内訳として PyTorch の起動を挙げており、FT-HSDP の実装基盤として用いられている。(Source: [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]]) PyTorch の分散データ並列(DDP)は [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]] の共著者でもある Shen Li・Yanli Zhao・Rohan Varma・Omkar Salpekar らにより VLDB 2020 で報告され、[[ZeROパラメータシャーディング]] を実装する Fully Sharded Data Parallel(FSDP)は PyTorch のテンソル実装・ディスパッチャ・CUDA メモリキャッシュアロケータと緊密に共設計された産業グレード実装として位置づけられる。FT-HSDP の著者にも PyTorch Distributed/FSDP の設計に関わった Rohan Varma・Omkar Salpekar が名を連ねており、PyTorch の分散訓練コンポーネントの知見が FT-HSDP の設計に連続している。(Source: [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]], [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]]) PyTorchのプロファイリング・チューニングスタックとしては、`torch.profiler`(Kineto)によるオペレータ単位の内訳、NVTXマーカーを介したNsight Systems/Nsight Computeとの相互運用、Linux `perf`によるホスト側計測、Holistic Trace Analysis(HTA)によるマルチGPUトレース統合が体系化されている。分散訓練の観点では、FSDPの`activation_checkpointing_policy`と`CPUOffload`による自動チェックポイント/オフロード、`HYBRID_SHARD`(ノード内シャーディング+ノード間複製)と`FULL_SHARD`(ZeRO Stage-3)の使い分けが提供され、[[torch.compile]]と組み合わせる際はトランスフォーマーブロック単位でFSDPをラップすることで計算と通信(all-gather/reduce-scatter)のオーバーラップが最大化される。また`torch.cuda.CUDAGraph` APIおよびコンパイラ内部の[[CUDAGraph]] Trees(`mode="reduce-overhead"`)によりカーネル起動オーバーヘッドを削減する。(Source: [[@2025__OReilly__AI Systems Performance Engineering - Chapter 13 Profiling, Tuning, and Scaling PyTorch]]) ## 関連 - ソース: [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]] / [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]] / [[@2025__OReilly__AI Systems Performance Engineering - Chapter 13 Profiling, Tuning, and Scaling PyTorch]] - エンティティ: [[Meta]] / [[Rohan Varma]] / [[Omkar Salpekar]] / [[Yanli Zhao]] / [[FT-HSDP]] - 概念: [[ZeROパラメータシャーディング]] / [[LLM分散学習]] / [[torch.compile]] / [[CUDAGraph]] ## 出典 - [[@2023__VLDB__PyTorch FSDP Experiences on Scaling Fully Sharded Data Parallel]](PyTorch FSDP の設計・実装) - [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]](復旧プロセスにおける PyTorch 起動オーバーヘッドへの言及) - [[@2025__OReilly__AI Systems Performance Engineering - Chapter 13 Profiling, Tuning, and Scaling PyTorch]](プロファイリングツール群、FSDP自動チェックポイント/オフロード、torch.compileとの統合)