# Zoomer
[[Meta]] が開発する、AI の訓練・推論ワークロードを横断する性能プロファイリング、デバッグ、分析、最適化の統合プラットフォーム。GPU メトリクス、GPU/CPU 実行トレース、ホストテレメトリ、アプリケーション注釈、集合通信、推論要求データを収集し、ボトルネック、ストラグラー、クリティカルパス、メモリ問題、負荷不均衡を分析する。(Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]])
## 構成
Zoomer は次の三層を持つ。
- **インフラストラクチャ/プラットフォーム層**: [[Manifold]] によるトレース保存、フォールトトレラントな処理パイプライン、低レイテンシなデータ収集、自動プロファイリングトリガー。
- **分析/洞察エンジン層**: [[Kineto]]、NVIDIA DCGM、[[StrobeLight]]、[[Dynolog]] を用いた GPU/CPU/ホスト分析、通信パターン分析、ストラグラー検知、メモリ分析、推奨生成。
- **可視化/ユーザーインターフェース層**: rank 横断タイムライン、複数イテレーション比較、パーセンタイル分析、[[Perfetto]] トレース表示、GPU 効率ヒートマップ、自動洞察要約。
## ワークロード対応
訓練ではイテレーション 550〜555 付近を自動プロファイリングし、定常状態を対象にする。分散訓練向けには rank 間ストラグラー分析、クリティカルパス分析、2 GB 超のトレース処理、N 次元並列化可視化を提供する。推論ではオンデマンドプロファイリング、自動負荷試験との連携、[[Crochet]] による要求単位分析、リアルタイム GPU メモリプロファイリングを使う。(Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]])
GenAI 向けの LLM Zoomer は 100k GPU 超のワークロードを対象にし、tensor、pipeline、data、expert parallelism の相互作用を可視化する。Zoomer Actionable Recommendations Engine(Zoomer AR)はアンチパターンから自動修正差分、最適化ノートブック、提案設定での再実行を生成する。NVIDIA GPU、AMD MI300X、MTIA、CPU の異種環境を同じ分析基盤で扱うことも目標とされる。(Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]])
## 報告された効果
Meta は Zoomer の利用により、2024 年の Ads 関連モデルで訓練時間 75% 短縮・電力消費 78% 削減、32k GPU ベンチマークで 30% 高速化、64k GPU 構成で 25% 高速化、モデルに応じた推論 QPS 2〜50% 改善などを報告している。ただし、記事は測定条件や比較対象を詳述していないため、数値は公式記事による報告値として扱う。(Source: [[@2025__EngineeringAtMeta__Zoomer - Powering AI Performance at Meta's Scale Through Intelligent Debugging and Optimization]])
## 関連
- 開発元: [[Meta]]
- 分析基盤: [[Kineto]] / [[Dynolog]] / [[NVIDIA Data Center GPU Manager]] / [[StrobeLight]] / [[Crochet]] / [[Perfetto]]
- 概念: [[GPU観測性]] / [[パフォーマンスエンジニアリング]] / [[GPUエネルギー効率]] / [[ストラグラー]] / [[クリティカルパス分析]] / [[並列化戦略]] / [[LLM学習モニタリング]] / [[LLM推論]]