# Toto
## 定義
Toto(Time Series Optimized Transformer for Observability)は [[Datadog]] AI Research が開発した、観測時系列データ(オブザーバビリティメトリクス)に特化したゼロショット時系列予測の[[時系列基盤モデル]]。151Mパラメータのデコーダ専用トランスフォーマで、次パッチ予測タスクで事前学習される。([[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
## 役割・位置づけ
- 観測データの非定常性・高カーディナリティ多変量・裾の重い分布に対応する4つの専用要素を持つ: patch-based causal instance normalization / proportional factorized attention(time:variate=11:1)/ Student-T mixture head / composite robust loss。
- 事前学習コーパスは約2.36兆点(うち43%が Datadog の匿名観測メトリクス)で、主要 TSFM の4〜10倍の規模。
- ベンチマーク [[BOOM]] で CRPS を次点比12.4%改善、汎用ベンチマーク GIFT-Eval・LSF でもゼロショット SOTA。
- 重み・推論コード・評価スクリプトを Apache 2.0 で公開(<https://huggingface.co/Datadog/Toto-Open-Base-1.0>, <https://github.com/DataDog/toto>)。
- [[@2025__arXiv__Cisco Time Series Model Technical Report]] の比較対象でもある。Toto-1.0 は同論文の観測データ評価で次点級の競合だが、Cisco TSM(多解像度 512+512)が MASE・CRPS 等のほぼ全指標で上回る(例 表1 で CRPS 0.4126 対 Toto 0.4932)。観測データ特化という設計思想は Cisco TSM と共通だが、Cisco TSM は長コンテキストを多解像度で扱う点が異なる。
- 予測専用の TSFM にとどまらず、**時系列質問応答(TSQA)の時系列エンコーダ**としても再利用される。[[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]] は、事前学習済みの Toto を VLM([[Qwen3-VL]] 32B)と結合学習したハイブリッド [[Toto-1.0-QA-Experimental]] を構築し、Toto の埋め込みを variate embedding MLP で VLM 空間へ射影することで、ARFBench で全モデル最良の精度 63.9% を達成した。時系列エンコーダをスクラッチ学習する従来の時系列 LLM と異なり、事前学習済み TSFM の再利用が鍵という立場。
- TSFM のサーベイ [[@2025__arXiv__Foundation Models for Time Series - A Survey]] では、Toto は decoder-only・パッチベース・確率的(Student-T mixture による Negative Log-Likelihood)・単変量/多変量両対応として 6 次元タクソノミーに位置づけられる。事前学習データは Datadog の内部生成データと記述される(同サーベイ §5 ISSUES)。
> [!contradiction] [[@2025__arXiv__Foundation Models for Time Series - A Survey]] とパラメータ数・事前学習データ点数が食い違う
> 本ページと [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] は Toto を **151M パラメータ・約 2.36 兆点**とする。一方 [[@2025__arXiv__Foundation Models for Time Series - A Survey]] は **103M パラメータ・1 兆点**(Table 2)とする。サーベイ(2025-04)は Toto の初期 arXiv 版(2407.07874, 2024-07)を参照しており、NeurIPS 2025 版は更新版であるため、**モデルバージョンの差**による不一致と見られる。要確認。
## Toto 2.0(2026-05-14)
[[Datadog]] AI Research が Toto の第 2 世代として 4M〜2.5B パラメータの 5 サイズ family を発表。技術レポートは arXiv:2605.20119。([[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]])
### 主要革新
- **[[Contiguous Patch Masking]](CPM)**: 学習時に連続パッチを一括マスクすることで推論時のシングルパス予測を実現。Toto 1.0 比でレイテンシ大幅削減(313M が Chronos-2 120M と同等レイテンシ)。
- **[[u-μP]] ハイパーパラメータ転移**: 小規模プロキシモデルでチューニングし大規模モデルへ転移。スケーリング実験コスト削減。`dd_unit_scaling` ライブラリを Apache 2.0 公開。
- **スケーリング則の確認**: 4M〜2.5B で単調改善・飽和なし。22M が Toto 1.0(151M)の 7 分の 1 パラメータで同等性能。
- **[[NorMuon]] オプティマイザ**: Muon の改良版。ピンボール損失との組み合わせで生じる符号値勾配問題を per-neuron の EMA スケール正規化で解決。全学習で一貫して採用。
- **定量的出力ヘッド**: ピンボール損失(分位点損失)を用いた確率的予測ヘッドを採用。Student-T mixture に代わる設計。
- **Polar Express 直交化**: Newton-Schulz 直交化の代替として Polar Express を採用可能(NorMuon 更新則の構成要素)。
### Toto 2.0 のベンチマーク結果
| ベンチマーク | 結果 |
|---|---|
| BOOM | 全 5 サイズが競合上回り全サイズがパレートフロンティア |
| GIFT-Eval(ゼロショット) | 上位 3 位を 2.5B・1B・313M が独占 |
| GIFT-Eval(FT) | アンサンブル「Family and Friends」が 1 位、2.5B FT が 2 位 |
| TIME(汚染耐性) | 全指標で上位 3 位を独占 |
### 著者(Toto 2.0)
[[Emaad Khwaja]] / [[Chris Lettieri]] / [[Gerald Woo]] / [[Eden Belouadah]] / [[Marc Cenac]] / [[Xunyi Zhao]] / [[Viktoriya Zhukova]] / [[Othmane Abou-Amal]] / [[Chenghao Liu]] / [[Ameet Talwalkar]] / [[David Asker]] ほか
## 関連
- エンティティ: [[Datadog]](開発元)/ [[BOOM]](同時公開の評価 benchmark)/ [[GIFT-Eval]] / [[TIME]](汚染耐性ベンチマーク)/ [[NorMuon]](採用オプティマイザ)/ [[Carnegie Mellon University]](共同研究)/ [[Cisco]]・[[TimesFM]](同じ TSFM 群)/ [[Toto-1.0-QA-Experimental]](TSQA ハイブリッドへの再利用)/ [[ARFBench]]
- 著者(v1.0): [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] を参照
- 著者(v2.0): [[Emaad Khwaja]] / [[Chris Lettieri]] / [[Gerald Woo]] / [[Eden Belouadah]] / [[Marc Cenac]] / [[Xunyi Zhao]] / [[Viktoriya Zhukova]] / [[Othmane Abou-Amal]] / [[Chenghao Liu]] / [[Ameet Talwalkar]] / [[David Asker]] ほか
- ソース: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] / [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]] / [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]] / [[@2025__arXiv__Cisco Time Series Model Technical Report]] / [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]] / [[@2025__arXiv__Foundation Models for Time Series - A Survey]]
- 概念: [[時系列基盤モデル]] / [[時系列質問応答]] / [[Contiguous Patch Masking]] / [[u-μP]]
- 関連 MOC: [[時系列基盤モデル - MOC]] / [[Telemetry - MOC]]
## 出典
- [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]](Toto 1.0)
- [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]](Toto 2.0、arXiv:2605.20119)
- [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]](Toto 2.0 arXiv 版)
- [[@2025__arXiv__Cisco Time Series Model Technical Report]](比較対象 Toto-1.0)
- [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]]
- [[@2025__arXiv__Foundation Models for Time Series - A Survey]](Table 2/§5: TSFM タクソノミーでの Toto の分類)