gt;$768 ステップ)ではブロックデコーディングを使用。 ## Toto 2.0 での効果 ([[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]]) - **推論レイテンシ**: 全サイズで Toto 1.0(自己回帰)比で大幅削減。313M が Chronos-2(120M)と同等のレイテンシで動作。 - **精度**: CPM は精度も同時に改善——長スパンマスクで将来の文脈的予測を学習することで品質向上。 - **長ホライズン安定性**: 2.5B が 8,192 ステップまで多スケール合成信号の構造を保持($r=0.818$)。自己回帰モデルはこのスケールで大幅に低下。 ## 横断的知見 - **CPM のトランスフォーマーへの適応が自己回帰の 2 つの問題(レイテンシ・コンパウンドエラー)を同時解決**: 元の設計(Auer et al. 2025)は xLSTM 向けだが、Toto 2.0 のトランスフォーマーへの適応でシングルパス推論が成立する。SSM では $|M|$ 回の計算が必要なため恩恵が小さいが、トランスフォーマーでは Attention が全位置を一度に処理するため真のシングルパスになる。アーキテクチャ種別によって CPM の効果が質的に異なる。(Source: [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]]) ## 未解決の問い - 学習時のランダム連続スパンと推論時の「一定長の将来スパン」の分布差がどの程度性能に影響するか。$c_{\max}=16$ より長い学習スパンはさらに良いか。 - ブロックデコーディングの安定化閾値(約 768 ステップ)はモデルサイズ・学習コンテキスト長に依存するか。2.5B ではより長い安定範囲があるか。 - 他の TSFM(Chronos-2・TimesFM 等)に同じ CPM を適用した場合、精度とレイテンシはどの程度改善するか。CPM の有効性がトランスフォーマー TSFM 一般に適用できるか。 ## 関連 - エンティティ: [[Toto]] / [[Datadog]] - ソース: [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]] / [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]] - 概念: [[時系列基盤モデル]] / [[u-μP]] ## 出典 - [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]] - [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]]