# TorchTitan
[[PyTorch]]ネイティブな本番向けLLM事前訓練フレームワーク(Liang+, arXiv:2410.06511「TorchTitan: One-stop pytorch native solution for production ready llm pre-training」)。
[[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]]は[[CCL-Search]]を用いてLlama-3.1-8B(16 Perlmutter GPU)上でTorchTitanと[[Megatron-LM]]をそれぞれ15イテレーション探索し、TorchTitanの最良構成(TP=1, DP=4, PP=4、step time 1.50s)とMegatron-LMの最良構成(TP=4, DP=1, PP=4、0.44s)が構成空間上の異なる点にあり3.4倍の性能差を持つことを示した(Claim 3)。TorchTitanの最適構成をMegatron-LMへ転用すると1.3s(TorchTitan自身より15%速いがMegatron-LM自身の最適比では3倍遅い)であり、並列化構成の転移不可能性を裏付ける。
## 関連
- 本ソース: [[@2026__arXiv__CCL-Bench 1.0 - A Trace-Based Benchmark for LLM Infrastructure]]
- 基盤: [[PyTorch]]
- 比較対象: [[Megatron-LM]]
- 評価基盤: [[CCL-Bench]]