# Omkar Salpekar [[Meta|Meta Platforms]] のエンジニアで、10 万 GPU 規模の LLM 事前学習向け耐障害訓練パラダイム [[FT-HSDP]] を提案した論文([[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]])の筆頭著者。データ並列レプリカを耐障害性の単位とし、CPU 駆動の制御ロジックと GPU 駆動のデータ転送を組み合わせた Fault Tolerant All Reduce(FTAR)プロトコルと非ブロッキング catch-up プロトコルを設計し、98K H100 GPU の実クラスタで有効訓練時間を 44% から 80% へ改善したと報告する。(Source: [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]]) ## 関連 - ソース: [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]] - エンティティ: [[Meta]] / [[Rohan Varma]] / [[Chunqiang Tang]] / [[Maxim Naumov]] / [[FT-HSDP]] - 概念: [[耐障害LLM訓練]] / [[LLM分散学習]] ## 出典 - [[@2026__arXiv__Training LLMs with Fault Tolerant HSDP on 100,000 GPUs]](筆頭著者)