# Zero Bubble Zero Bubbleは、パイプライン並列化でGPUが処理できない時間を減らし、理想的にはパイプラインバブルを0にするスケジューリング手法である。[[PLaMo-100B]]では3D parallelismのパイプライン並列化に採用された。(Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]) ## 実運用上の含意 Zero Bubble論文が導入した投機的なパラメータ更新は、PLaMo-100Bでは採用されなかった。イテレーション境界がPythonスクリプト上で曖昧になりデバッグが難しくなること、gradient clippingが常に発生して投機実行が成功する反復がほとんどなかったことが理由である。これは、バブル削減の理論的効果と、更新方式を含む実装のデバッグ容易性が別の設計軸であることを示す。(Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]) ## 横断的知見 - [[パイプライン並列化]]に蓄積されたGPipe・1F1B・ReCycleの知見と合わせると、バブル削減はスケジュールの効率だけでなく、メモリ、更新の同期性、障害復旧、デバッグ容易性との協調設計を要する。(Source: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]], [[@2024__SOSP__ReCycle - Resilient Training of Large DNNs using Pipeline Adaptation]]) ## 未解決の問い - モデル規模やgradient clippingの頻度が、Zero Bubbleの投機的更新の有効性をどの程度左右するか。 - Zero Bubbleのバブル削減効果と、障害復旧・再現性・デバッグコストを同一の評価軸で比較できるか。 ## 関連 - 概念: [[パイプライン並列化]] / [[並列化戦略]] / [[LLM分散学習]] - エンティティ: [[PLaMo-100B]] / [[Megatron-LM]] - 出典: [[@2024__Preferred Networks__1,000億パラメータ規模の独自LLM「PLaMo-100B」の事前学習]]