# 時系列基盤モデル
## 定義
時系列基盤モデル(Time Series Foundation Model, TSFM)は、大規模な多ドメイン時系列で事前学習し、ドメインごとの再学習や fine-tuning なしにゼロショット予測ができる基盤モデル。実運用の観測システムは数百万〜数十億の異なる時系列を生成し、系列ごとの教師あり学習が非現実的なため、単一モデルを水平スケールして低遅延・低コストの推論を提供できる TSFM が有力視される。([[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
[[@2025__arXiv__Foundation Models for Time Series - A Survey]] はより一般的に、TSFM を NLP の基盤モデル(LLAMA・BERT・GPT)のパラダイムを時系列へ拡張したものと位置づける。定義的特徴は**多様な下流タスク(予測・異常検知・分類・補完・変化点検知)の汎用バックボーンとして機能する**ことで、これを大規模データでの**事前学習**と特定タスクへの **fine-tuning** の 2 段階プロセスで達成する。一般化を支える性質は (1) タスク非依存の自己教師あり事前学習目的(next-step prediction・masked reconstruction・contrastive learning)、(2) 異種ドメインデータでの学習によるドメイン横断のスケーラビリティ、(3) fine-tuning による適応性の 3 つ。ゼロショット予測に力点を置く観測システム視点の定義(上記)に対し、サーベイは fine-tuning による多タスク適応まで含めて TSFM を捉える点で力点が異なる。([[@2025__arXiv__Foundation Models for Time Series - A Survey]] §2.4)
## 横断的知見
- **TimeGPT-1(2023)が TSFM 研究の起点であり、その後の全モデルは「ゼロショット精度と汎化」という競争軸を TimeGPT が設定した枠内で戦っている**: [[@2023__arXiv__TimeGPT-1|TimeGPT]] ([[@2023__arXiv__TimeGPT-1]])は 100B 点超の多ドメイン時系列で事前学習したエンコーダ・デコーダ Transformer をゼロショット推論し、月次 rMAE 0.727 で NHITS(0.738)・TFT(0.752)等の専用学習モデルを上回った。このとき 0.6 ms/系列という統計手法の 1/1000 の速度優位が「精度とコストの両立」という実用的フレームを設定した。後続の Chronos・TimesFM・Toto が評価軸として採用した「ゼロショット精度」「再訓練不要の汎化」「推論コスト」はすべて TimeGPT-1 が 2023 年時点に定義した競争軸である。一方で TimeGPT はモデル重みを非公開にし、後続の Chronos(2024)/TimesFM(2024)/Toto(2025)は公開重みを提供することで研究コミュニティへのアクセスを拡大した。(Source: [[@2023__arXiv__TimeGPT-1]])
- **LLM を転用するより時系列専用に学習した方がゼロショット精度が大幅に高い**: [[TimesFM]](Das+, 2024)は 200M パラメータと O(100B) 時系列点という LLM より桁違いに小さな規模で、GPT-3 ベースの llmtime よりゼロショット Monash 幾何平均スケーリング MAE を 25% 以上改善した。NLP の語彙・文法を持つ LLM はトークン化された時系列を直接処理しにくく、時系列特有のパッチ化・可変長コンテキスト・粒度変化への対応を専用設計で初めて効率よく実現できる。この「専用 > 転用」という観察は、後続の [[Toto]]/[[BOOM]] が観測ドメイン特化で汎用 TSFM をさらに上回る路線へとつながる。(Source: [[@2024__arXiv__A Decoder-Only Foundation Model for Time-Series Forecasting]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **Wikipedia ページビューという大規模公開 Web データが TSFM の事前学習コーパスの主要源になりうる**: TimesFM は 〜300B 点の Wikipedia ページビュー時系列をコーパスの大部分に採用し、〜0.5B 点の Google Trends・3M 系列 ×2048 点の合成データと組み合わせた。財務・医療などのプライベートデータなしに、公開ウェブデータだけで多ドメイン・多粒度のゼロショット汎化を達成した先例。後続の [[Toto]]/[[BOOM]] が観測ドメイン専用データで特化するアプローチとの対比として、「汎用 Web データ × 合成データ」路線の代表。(Source: [[@2024__arXiv__A Decoder-Only Foundation Model for Time-Series Forecasting]])
- **多変量化が次の主戦場**。初期 TSFM の多くは channel independence で単変量に閉じていたが([[Toto]] 論文が指摘)、2026 年には [[Falcon-X]] が「ほとんどの TSFM は依然として単変量」と同じ問題を起点に cross-variate モデリングを正面の課題に据える。両ソースとも単変量の限界を出発点に据える点で一致。詳細手法の比較は [[多変量時系列予測]] に集約。(Source: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **観測・運用データへの収斂**。[[Toto]]/[[BOOM]] は Datadog の観測メトリクスに特化し、[[Falcon-X]] も事前学習に alibaba_cluster_trace・azure_vm_traces・borg_cluster_data を含み、評価に観測系の BOOMLET([[BOOM]] 部分集合)を使う。汎用 TSFM の評価軸が観測テレメトリへ広がりつつある。(Source: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **アーキテクチャの分岐**: [[Toto]] は decoder-only(151M、次パッチ予測)、[[Falcon-X]] は encoder-only(591M、masked reconstruction + 時間/変量の分離)。スケールも 151M→591M と拡大し、Falcon-X は 59M→591M で neural scaling law に従うと報告。(Source: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- 評価指標は MASE(点予測)・CRPS(確率的較正)が de facto 標準として両ソースで共通利用される。(Source: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **絶対スケール情報の保持が TSFM の性能を決定的に左右する**: [[TelecomTS]]([[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]])は NME(Numerically Multi-scaled Embedding)分岐のあり/なしで 5 アーキテクチャを比較し、スケール情報の追加が**ほぼ全モデル・全タスクで一貫して性能を向上**させることを実証した。Autoformer は RCA で +30.4 ポイント(0.280→0.584)、Informer は異常検知 F1 で +0.401(0.451→0.852)。[[Toto]] が観測データの事前学習により異常検知 F1 0.615・RCA 精度 0.848 で他の TSFM を大幅に上回る一方、Toto 自体はスケールを明示的にエンコードしない——Mantis(NME 搭載)が異常検知 F1 0.800 で Toto を上回る。[[BOOM]] が「正規化で失われる情報」を指摘し、TelecomTS がその影響を定量化した構図。(Source: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]], [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]])
- **オブザーバビリティデータの「正常な急変動」が TSFM を欺く**: [[TelecomTS]] は、ストリーミング起因の TX_Bytes スパイクが全モデルで偽陽性を誘発する失敗パターンを報告(Figure 6)。[[Toto]]/[[BOOM]] が「観測データは既存 TSFM の事前学習分布外」と示した知見の延長だが、TelecomTS は予測でなく検知・分類タスクにおいてこの問題を定量化した。観測データ特化の事前学習(Toto)は予測だけでなく検知・RCA でも汎用 TSFM を大幅に凌駕するが、正常変動の弁別は依然不完全。(Source: [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **TSFM は AIOps の異常検知/障害種別分類の手法系統でもある**: [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models]] は Lag-Llama・TimesFM(decoder-only)・TimeGPT・SimMTM(encoder-decoder)等の時系列基盤モデルを、AIOps の [[異常検知]]・failure category classification の主要手法として整理する(§5.1)。Toto/BOOM が「観測テレメトリ予測の精度」を競う文脈と、サーベイが「予測ベースの異常検知」を AIOps タスクの一手段とみなす文脈はつながっており、TSFM の予測精度向上は下流の異常検知・[[障害予測]]の入力になる。汎用 TSFM 研究(予測タスク)と AIOps 研究(検知タスク)が、同じ基盤モデルを別の評価軸で見ている。(Source: [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **観測データ特化のアプローチに「多解像度の長コンテキスト」という新軸が加わる**: [[Toto]]/[[BOOM]] は観測データ特化の事前学習とアーキテクチャ(causal scaling 等)で汎用 TSFM を凌ぐ路線だが、[[@2025__arXiv__Cisco Time Series Model Technical Report]] は**長コンテキストを効率的に扱う多解像度入力**(粗い 1 時間と細かい 1 分のコンテキストを連結)を直交する軸として加える。両者とも観測ドメインで競合 TSFM(Toto/Chronos/TimesFM)を上回る点で一致するが、Cisco TSM は「過去パターンが長期に持続する観測ドメインでは長い履歴が決定的」という観察から出発し、Toto は「観測データの分布・裾の重さ」から出発する点で着眼が異なる。Cisco TSM の評価では Toto-1.0 が観測データで次点級の競合として現れる。(Source: [[@2025__arXiv__Cisco Time Series Model Technical Report]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **既存 TSFM への「継続事前学習 + 小さなアーキテクチャ追加」という低コストな拡張路線**: [[@2025__arXiv__Cisco Time Series Model Technical Report]] は新規モデルをゼロから作らず、[[TimesFM]] に特殊トークンと解像度埋め込みを足して継続事前学習(CPT)するだけで観測ドメインの優位と汎用能力の維持を両立した。ゼロからの学習や凍結スケジュールより CPT が最速で収束したと報告。[[Toto]]・[[Falcon-X]] が大規模な専用モデルを新規に学習する路線と対照的で、「既存 TSFM のアーキテクチャ改変 + 新ドメインデータの取り込み」を同時に行う実践的な道筋を示す。汎用パターンとして他の TSFM にも適用可能と主張する。(Source: [[@2025__arXiv__Cisco Time Series Model Technical Report]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **ベンチマーク leakage の扱いが TSFM 評価の共通課題**: [[GIFT-Eval]] を使う複数ソースが leakage を意識する。[[@2025__arXiv__Cisco Time Series Model Technical Report]] は TimesFM 2.0 の学習コーパスに含まれるデータセットを除いた「non-leaking」版で評価し、コンテキスト ≥ 512 の長コンテキスト部分集合を分離して報告する。[[Falcon-X]] も GIFT-Eval 事前学習部分を使いつつテストとのリーク回避を明記。観測テレメトリ由来データ(自社運用ログ)で out-of-domain かつ in-the-future な test を構築する手法は、leakage を構造的に避ける一手段になりうる。(Source: [[@2025__arXiv__Cisco Time Series Model Technical Report]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **TSFM の精度向上は予測パラダイムの終着点ではない——[[エージェント型時系列予測]]が「上の層」を主張する**: TSFM 研究が「より良い単一モデル」を競うのに対し、ATSF([[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]])は予測パラダイムの進化表(Table 1)で Foundation Models をツール利用(✗)・進化(✗)に分類し、進歩の主軸をモデル反復からシステム・ツールレベルの進化へ移すべきだと論じる。ATSF はモデル規模と直交し、TSFM を「置換せず行動空間の 1 ツール(predictive modeling tool)として呼び出す」立場を取る。Toto/Falcon-X が追う「単一モデルの精度・汎化」と、ATSF が追う「予測プロセスの組織化」は競合せず階層をなす。(Source: [[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **ATSF が掲げた「TSFM を行動空間の 1 ツールとして呼ぶ」立場が、実装 [[Cast-R1]] で具体化・実証された**: ひとつ前の項目で見た ATSF の主張(TSFM を置換せず predictive modeling tool として呼ぶ)を、同グループの [[Cast-R1]]([[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]])が [[Chronos-2]]・[[TimesFM]]・PatchTST・iTransformer・ARIMA・DLinear を統一予測インタフェースのツールとして公開する形で実装した。アブレーション(Table 12)で [[Chronos-2]] 単独除去が volatile な NP で MSE 22.5→55.4 と劇的に劣化し、zero-shot レジーム適応で基盤モデルが他ツールに置換できない寄与を持つことを示す。一方で予測モデルツール全体の除去(Table 3)はさらに深刻(ETTh1 6.062→15.993)で、エージェントの推論は予測モデルを置換できず「実行可能ツール」として必要とする。TSFM の精度向上が ATSF の行動空間を底上げする一方向の証拠だが、「高精度 TSFM ほど省察・再計画の余地が縮むか」という双方向のトレードオフは依然未検証。(Source: [[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]], [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]])
- **TSFM 研究の「単一最良モデル」競争の上に「アンサンブル・オーケストレーション層」が乗る——複数 TSFM の結合が単体 SOTA を上回る**: 個別 TSFM 研究([[Toto]]/[[Falcon-X]]/[[Chronos-2]])が単一の最良モデルを競うのに対し、[[TimeCopilot]]([[@2025__arXiv__TimeCopilot]])は複数 TSFM を単一 API 下に集約し、MedianEnsemble([[Chronos-2]]+[[TimesFM]]+[[TiRex]] を isotonic regression で結合)で GIFT-Eval 確率予測 CRPS の平均ランク・平均スコアを各単体モデルより上に押し上げた(約 $24 の低コストで全体最良、点予測 MASE では Chronos-2 に次ぐ 2 位)。これは [[エージェント型時系列予測]] が掲げる「TSFM を置換せず行動空間の 1 ツールとして束ねる」立場の Workflow 系での具体化であり、TSFM の精度向上が予測性能の終着点でなく、異種モデルのアンサンブルがさらに上を生むことを示す。ただし寄与の主因はアンサンブル手法であり、本体論文は個別 TSFM の精度向上分とアンサンブルの結合効果を切り分けていない。(Source: [[@2025__arXiv__TimeCopilot]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **予測専用 TSFM が「TSQA の時系列エンコーダ」として再利用される**: [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]] は、予測専用に事前学習した [[Toto]] を VLM([[Qwen3-VL]] 32B)と結合学習した [[Toto-1.0-QA-Experimental]] で、時系列質問応答([[時系列質問応答]])ベンチマーク [[ARFBench]] の全モデル最良精度(63.9%)を達成した。Toto の埋め込みを variate embedding MLP で VLM 空間へ射影し、文脈長が系列長に比例して伸びるのを防ぐ。これは [[Toto]]/[[BOOM]] が追う「予測精度」とは別軸の TSFM 活用——時系列エンコーダをスクラッチ学習する従来の時系列 LLM(ChatTS・OpenTSLM)と異なり、事前学習済み TSFM の再利用が鍵という立場。汎用 TSFM 研究(予測)・AIOps 研究(検知)に続き、TSQA(推論)が TSFM の第 3 の評価軸として加わる。(Source: [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **汎用サーベイの 6 次元タクソノミーが、vault が個別に深掘りしてきた TSFM 群に分類フレームを与える**: [[@2025__arXiv__Foundation Models for Time Series - A Survey]] は 15 モデルを (1) アーキテクチャ(Non-Transformer/Encoder-decoder/Encoder-only/Decoder-only/Adapting LLM)、(2) パッチ有無、(3) 目的関数、(4) 単変量/多変量、(5) 確率的/決定論的、(6) 規模の 6 軸で横断分類する。vault が個別に観察した「アーキテクチャの分岐」([[Toto]]=decoder-only、[[Falcon-X]]=encoder-only)はこの軸(1)の、「多変量化が次の主戦場」は軸(4)の具体例にあたり、本サーベイはこれらに包括的な座標系を与える。一方サーベイは観測(observability)ドメインの統計的特性(分布外・裾の重さ)を扱わず、[[Toto]] を「[[Datadog]] の内部生成データで学習」とだけ記述する——**汎用 ML 視点の地図(本サーベイ)と観測特化研究(Toto/BOOM/Cisco TSM)の視点差**が、同じモデルに対する記述の粒度として現れる。(Source: [[@2025__arXiv__Foundation Models for Time Series - A Survey]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **評価指標の二分(MASE 対 CRPS)は訓練目的関数の二分(点予測 対 確率的)と対応する**: [[@2025__arXiv__Foundation Models for Time Series - A Survey]] は目的関数を独立の分類軸に立て、点予測系(MSE: TimesFM/MOMENT/Timer、Huber: Time-MOE)と確率的系(NLL: Toto/Lag-Llama、Cross Entropy: Chronos、Log-Likelihood: MOIRAI)を分ける。これは vault が観察した「MASE(点予測)・CRPS(確率的較正)が de facto 標準」という評価軸の二分と表裏で、確率的 TSFM(Toto/Chronos/MOIRAI)が CRPS で、点予測 TSFM(TimesFM)が MASE/MSE で測られるのは訓練目的関数の選択に根ざす。(Source: [[@2025__arXiv__Foundation Models for Time Series - A Survey]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **TSFM でスケーリング則が初めて確立——Toto 2.0 が「BERT モーメントから GPT-2 モーメントへ」を宣言**: Toto 1.0 とその同時代の TSFM が「TSFM の BERT モーメント」(多様な下流タスクへの適用が示された段階)に相当したとすれば、[[Toto]] 2.0([[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]])は 4M〜2.5B の 5 サイズで単調かつ信頼できるスケーリングを実証し「TSFM の GPT-2 モーメント」を宣言した。全サイズが 1 つ下のサイズを上回り(BOOM/GIFT-Eval/TIME 全ベンチ)、スケーリングが「研究課題」でなく「ツール」になった。これは[[@2025__arXiv__Foundation Models for Time Series - A Survey]]が指摘していた「スケーリングの失敗(大きいモデルが小さいモデルを下回ることがある)」を具体的に克服した初事例。公開データを事前学習に使わず汚染耐性ベンチ TIME でも同様のスケーリングが成立することは、スケーリング則が単なる訓練データ汚染の結果でないことを示唆する。(Source: [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]], [[@2025__arXiv__Foundation Models for Time Series - A Survey]])
- **TSFM の世代交代が速く、同名モデルでも参照時点でスペックが異なる**: [[@2025__arXiv__Foundation Models for Time Series - A Survey]](2025-04)は [[Toto]] を 103M・1 兆点、Chronos を T5 ベース単変量と記述するが、vault が後に取り込んだ [[Toto]](NeurIPS 2025 版、151M・約 2.36 兆点)・[[Chronos-2]](2025、group attention で多変量)は更新版で設計が異なる。サーベイは「地図」だが TSFM の進化が速く、描かれた時点で一部が既に古びる——TSFM を扱う際はモデル名だけでなく**バージョン・参照論文の年次**まで確認する必要がある。(Source: [[@2025__arXiv__Foundation Models for Time Series - A Survey]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **「モデル改良」路線に直交する「推論時ラッパー」路線が精度・効率を同時改善する**: [[Toto]]/[[Falcon-X]]/Chronos-2 等が TSFM のアーキテクチャや事前学習データを改良することで精度を競うのに対し、[[SPRINT]]([[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]])は既存 TSFM を学習不要のラッパーで包み、推論時のダウンサンプリングだけで精度 +19%・メモリ 6.35 倍削減・推論速度 16.87 倍改善を達成した(9 データセット・7 TSFM の平均)。これは TSFM の「精度と効率はトレードオフ」という通念に反し、ダウンサンプリングによるコンテキスト長の実質拡大がノイズ除去とルックバック延長の二重効果を生む。TSFM 研究の「何を学習させるか」という軸と「どう使うか(推論時最適化)」という軸が独立して価値を持つことを示す。(Source: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **季節性をモデル内部で学習するのではなく外部で複製する方向が、ゼロショット TSFM には有利**: Autoformer・TimesNet 等は季節分解をモデル内部構造として学習するが、[[SPRINT]] はパターン複製をモデル外部の学習不要な前処理として行う。実験では季節複製単体(Pattern Replication のみ)が全データセット・全 TSFM でベースラインを上回り(Table 3「Season Forecast」列)、TSFM の内部の季節モデリング能力よりシンプルな外部複製が長期予測には効くことを示した。これは「ゼロショット TSFM は高周波季節パターンを長期予測で正確に再現するのが苦手」という既存観察([[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])と整合する——[[Toto]]/[[BOOM]] が観測データの分布外を問題にした文脈に、「長期季節予測には外部複製が優る」という設計上の含意が加わる。(Source: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]])
- **「汎ドメイン TSFM vs ドメイン特化手法」の矛盾は和解不能であるとするポジションペーパーが登場**: [[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]] は、汎ドメイン TSF ニューラルネットワークの性能が近年飽和し(Accuracy Law: ETT・Electricity・Weather で頭打ち)、ハイパーパラメータ次第でテスト済み 8 手法のほぼ全てが「SOTA」になりうると指摘する(Brigato+ 2026)。さらに Kaggle コンペ上位手法(Optiver 3225 チーム、Jane Street 4085 チーム)は特徴量エンジニアリング+CatBoost/XGBoost 等であり、各ドメインのトップ会議論文(金融・気象・医療・交通)も汎ドメイン TSF NN を使わないと報告する。根拠として、時系列の近似誤差下界 O(1/√T) により NLP・CV のスケーリング則が TSF には適用できないと論じる。この「汎ドメイン TSFM は実務で使われない」という批判は、vault が観察してきた「観測データ特化の TSFM が汎用を凌ぐ」という流れ([[Toto]]/[[BOOM]]・[[@2025__arXiv__Cisco Time Series Model Technical Report|Cisco TSM]])と整合するが、本論文はさらに踏み込んで「汎ドメインアーキテクチャ研究自体の方向転換」を要求する。一方、TSFM 研究の貢献(ベンチマーク整備・新アーキテクチャの着想・エージェント系の行動空間への供給)を過小評価している面がある。(Source: [[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **VisionTS だけ効率改善ゼロという例外が TSFM のアーキテクチャ多様性を体現する**: [[SPRINT]] の効率改善は Attention ベースの TSFM が系列長に二乗で計算量が増えることを利用するが、VisionTS は時系列を固定解像度の画像として扱うため SPRINT のダウンサンプリングが効かない。7 TSFM 中 1 つだけが例外になることは、「Transformer 系か否か」というアーキテクチャ軸が推論時最適化の適用可能性を決定することを示す。サーベイが分類した「VLM-based」カテゴリ([[@2025__arXiv__Foundation Models for Time Series - A Survey]])は単なる系譜的分類ではなく、推論時の計算構造まで変える実質的な差がある。(Source: [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]], [[@2025__arXiv__Foundation Models for Time Series - A Survey]])
- **TSFM の対抗ポジションとしての「LLM ベース時系列推論」が、訓練不要・RL 訓練の両極で具体化された**: [[時系列推論]] パラダイム(TimeReasoner / AlphaCast / TimeOmni-1)は TSFM とは別の系譜で、LLM の言語推論能力を時系列タスクへ転用する。[[@2025__KDD__Can Slow-thinking LLMs Reason Over Time - Empirical Studies in Time Series Forecasting]] は TSFM を一切使わず DeepSeek-R1 を直接プロンプトし、複雑な時間動態を持つ ETTh1 等で深層学習ベースラインと競合する性能を達成。[[@2026__ICLR2026__TimeOmni-1 - Incentivizing Complex Reasoning with Time Series in Large Language Models]] は逆に「LLM 内に時系列推論能力を焼き付ける」方向で TSFM とは別アプローチを採る(Qwen2.5-Instruct-7B + SFT + GRPO で TimeOmni-1 を作り、因果発見で GPT-4.1 を上回る)。両者の存在は、TSFM 系譜と LLM 系譜が時系列モデリングの二つの主要パラダイムとして並列し、ATSF([[Cast-R1]]・[[TimeCopilot]]・[[TimeSeriesScientist]])や AlphaCast がその統合層として位置する構図を明確化する (Source: [[@2025__KDD__Can Slow-thinking LLMs Reason Over Time - Empirical Studies in Time Series Forecasting]], [[@2026__ICLR2026__TimeOmni-1 - Incentivizing Complex Reasoning with Time Series in Large Language Models]], [[@2025__arXiv__AlphaCast - A Human Wisdom-LLM Intelligence Co-Reasoning Framework for Interactive Time Series Forecasting]])。
- **観測特化 TSFM が「スケーリング時代」へ移行——4M〜2.5B の単調改善が飽和なしで続く**: [[Toto]] 2.0([[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]])は、観測 TSFM 初の本格的なスケーリング実験を行い、4M・22M・313M・1B・2.5B の 5 サイズで **BOOM CRPS が単調に改善し 2.5B でも飽和なし**と報告した。同時に 22M が旧 Toto 1.0(151M)の 7 分の 1 のパラメータで同等性能を達成し、スケーリングとパラメータ効率の両立を示す。これは NLP/CV で確立した「大規模化で精度は上がる」という経験則が観測特化 TSFM でも成立することを示す初の証拠であり、[[u-μP]] によるハイパーパラメータ転移がスケーリング実験コストを大幅に削減した技術的裏付けを持つ。BOOM・GIFT-Eval・TIME の全ベンチで上位独占し、**公開予測データセットを事前学習に使わず**(観測メトリクス+合成データのみ)この性能を達成した点は、汎化がデータ記憶でなくアーキテクチャ/手法に由来することを示す。(Source: [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]])
- **「時系列を LLM が直接読む」アプローチに知覚ボトルネックという固有の障壁がある**: [[@2024__arXiv__Towards Time-Series Reasoning with LLMs]] は時系列をテキストやプロット画像に変換して LLM に入力するアプローチが知覚段階で情報損失を起こすと指摘し、軽量パッチエンコーダ(MLP)+ LoRA で 7B モデルが GPT-4o をゼロショット分類で上回ることを示した。これは TSFM(Toto / Chronos / TimesFM)が自前のエンコーダで時系列を直接扱うことの設計上の優位を裏側から支える証拠となる——テキスト化を介する LLM 直接適用は本質的にハンディキャップを持つ (Source: [[@2024__arXiv__Towards Time-Series Reasoning with LLMs]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])。
- **TSFM サーベイの軸が「事前学習」から「事後学習(post-training)」へ拡張されつつある**: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]] は TSFM を「データセット — 事前学習 — 事後学習」の 3 次元タクソノミーで体系化し、先行サーベイ群([Ma+ TKDE 2024]・[Jin+ arXiv 2023]・[Liang+ KDD 2024]・[Ye+ 2024]・[Kottapalli+ 2025]・[Liu+ 2025])が事後学習を扱わない点を本サーベイの差別化点とする(Table I で 7 本との比較)。本 wiki の [[@2025__arXiv__Foundation Models for Time Series - A Survey]](Jin+ 2025)が 6 次元タクソノミー(アーキ/パッチ/目的関数/単・多変量/確率・決定論/規模)で「モデル設計」を切ったのに対し、本サーベイは「訓練ワークフロー」(事前 → 事後)で切る。両者は直交し、本サーベイの事後学習軸は SFT・PEFT(LoRA/Adapter)・多モーダル協調・知識蒸留・強化学習(GRPO/PPO/DPO)を**階層化された設計空間**として捉え直す。これは [[強化ファインチューニング]] が NLP・コード生成中心に展開してきた研究系譜が TSFM ドメインへ流入し始めている兆候。(Source: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]], [[@2025__arXiv__Foundation Models for Time Series - A Survey]])
- **協調的 fine-tuning が PLC / MLC / HLC の 3 階層で整理された**: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]] は外部依存度で TSFM の協調 fine-tuning を 3 段に分ける——PLC(parameter-level: LoRA・Adapter で軽量モジュール追加)、MLC(model-level: CLIP 流の LLM/VLM との多モーダル統合)、HLC(hybrid-level: 中規模モデルを介する知識蒸留)。本 wiki の [[Cast-R1]] が [[Chronos-2]]・[[TimesFM]] 等を「ツール」として呼び出す ATSF([[エージェント型時系列予測]])は、この 3 階層に直交する別軸(行動空間でのオーケストレーション)を提示する。サーベイは agent-based post-training を将来方向で 1 段落のみ扱い、Cast-R1・[[TimeCopilot]] 等の具体実装は未参照——本 wiki の方が踏み込んだ整理を持つ。(Source: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]], [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]], [[@2025__arXiv__TimeCopilot]])
- **推論駆動型 RL(GRPO)が NLP から TSFM ドメインへ越境**: サーベイは強化 fine-tuning を「推論駆動 vs 非推論」で二分し、GRPO + chain-of-thought + LLM 判別器の組み合わせ(Zhang+ TimeMaster・Luo+ SFT+GRPO・Xiao+ 金融 volatility-normalized reward)を TSFM への RL 持ち込みの代表例として整理する。本 wiki の [[強化ファインチューニング]] が DeepSeek-R1・DeepSWE・Cast-R1・TimeOmni-1 で観察した「GRPO の credit assignment の脆弱性」「規則ベース報酬の堅牢性」「SFT + RL の二段階」といった知見は、TSFM ドメインでも同じ設計課題が再現することを示唆する——サーベイは reasoning-driven RL を「萌芽期」と位置づけ、引用論文も少数(4 本)に留まる。(Source: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]], [[@2026__ICLR2026__TimeOmni-1 - Incentivizing Complex Reasoning with Time Series in Large Language Models]], [[@2025__arXiv__DeepSeek-R1 - Incentivizing Reasoning Capability in LLMs via Reinforcement Learning]])
- **「不規則時系列」が TSFM の構造的空白として独立軸で扱われた**: 本サーベイは既存 7 本との比較表(Table I)で「Irregular」列を持つ唯一のサーベイと自認し、MIMIC-III/IV・PhysioNet'12/'19・Human Activity・USHCN・PAM 等の不規則ベンチを事前学習(constant time-masking + contrastive、continuous latent space)・評価両面で扱う。本 wiki の TSFM 観察は規則的観測テレメトリ([[Toto]]/[[BOOM]])・規則 LTSF(ETT 系)に偏っており、不規則時系列(医療・センサー)での TSFM 性能は未整理。「観測データへの収斂」と「不規則時系列対応」は両立しうるか、それとも別系統の TSFM が必要かが新たに浮上する問い。(Source: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **単変量・多変量・共変量付き予測の統一が group attention + 合成データだけで実現できる**: [[Chronos-2]]([[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])は encoder-only トランスフォーマー内に Time Attention と Group Attention を交互配置し、グループ ID の割り当て方によって 3 モード(単変量・多変量・共変量付き)を同一アーキテクチャ・同一推論パスで切り替える。特筆すべきは**実世界の多変量データをほぼ用いずに多変量 ICL 能力を付与した**点で、Multivariatizer(cotemporaneous + sequential の 2 種)が単変量生成器からサンプルした系列に依存構造を合成的に付加する。fev-bench(100 タスク中 42 タスクが共変量付き)で共変量なし時の Skill Score 39.9 が ICL 適用で 47.0 まで改善し、TiRex・TimesFM-2.5・Toto-1.0 等の単変量専用 TSFM を大差で上回った。「高品質な実世界多変量データの不足」という業界課題を合成データで正面から回避する最初の本格的事例。(Source: [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- **Group Attention の $O(V)$ メモリスケーリングが多変量 TSFM の実用上限を押し上げる**: 先行多変量 TSFM の Moirai-1.0 は変量を平坦化するため計算量が変量数 $V$ に対し $O(V^2)$ となり高次元でスケールしない。[[Chronos-2]] の Group Attention は同一グループ内の同一パッチインデックスのみで注意を計算し $O(V)$ を実現する。Toto-1.0 は変量間 attention を持つが将来既知共変量・カテゴリカル共変量に非対応で、COSMIC は共変量付きに対応するが多変量ターゲットに非対応と、それぞれ制限を持つ。Chronos-2 はこれら全制限を $O(V)$ で解消する初の TSFM である(Table 1 比較)。これは [[多変量時系列予測]] における「変量間情報共有のコスト対効果」の設計問題に対する具体的解答を与える。(Source: [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- **Takens の埋め込み定理が多変量 ICL ゲインの小ささを説明する**: Chronos-2 のアブレーション(Figure 3・4)では、多変量タスクでの ICL ゲインが共変量付きタスクに比べて小さい。論文の考察はこれを Takens の埋め込み定理(十分に長い履歴があれば単変量観測から多変量システムの状態を再構成できる)で解釈する。つまり強力な単変量モデルが長い系列から多変量構造を暗黙的に捉えられるため、明示的な変量間情報共有の恩恵が限定される。この観察は「多変量ターゲット予測では univar モードの Chronos-2 でも Toto-1.0 を上回る」という実験結果と整合し、多変量 ICL の真価は将来既知共変量という「非対称情報」の活用にある。(Source: [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- **LLM 重みによる初期化は時系列 TSFM の精度を大きく向上させない**: Chronos([[@2024__arXiv__Chronos Learning the Language of Time Series]]、Ansari+ 2024)は T5 の言語モデル重みで初期化したモデルとランダム初期化モデルを比較し、初期化の差はベンチマーク全体で統計的に有意な優位をもたらさないことを示した。LLM が言語データから獲得した事前知識は、スケーリング + 量子化による時系列トークンには有効に転移しない——この知見は、LLM 転用 TSFM(One Fits All 等、[[LLM時系列アプローチ]])の理論的根拠である「言語事前学習の転移」の有効性に疑問を呈する。(Source: [[@2024__arXiv__Chronos Learning the Language of Time Series]])
- **実世界データ(〜890K 系列、〜84B 点)と合成データ(KernelSynth)の混合事前学習が TSFM の汎化を支える**: Chronos は 28 データセット(15 datasets in-domain、13 datasets pretraining-only)を混合し、さらにガウス過程カーネルをランダムに組み合わせて生成する KernelSynth 合成データを追加する。合成データ単体(Chronos-Bolt, KernelSynth)でも多くのゼロショットベンチ(Benchmark II)で専用モデル(N-BEATS 等)に匹敵する精度を達成した。「ゼロショット汎化は実データの多様性か合成データの多様性か」を問う先行文脈に対し、両者が補完的に寄与するというアーキテクチャ中立な答えを与える。(Source: [[@2024__arXiv__Chronos Learning the Language of Time Series]])
- **TSMixup(複数系列の凸結合)によるデータ拡張がゼロショット性能を底上げする**: Chronos は訓練時に $k$ 個の系列をランダムサンプリングして凸結合(混合比は Dirichlet 分布からサンプル)する TSMixup を採用した。Benchmark II(27 ゼロショットデータセット)での幾何平均スコアが TSMixup あり/なしで明確に改善することをアブレーションで示す。これは NLP/CV で定着した MixUp を時系列領域に持ち込んだ先例であり、[[Chronos-2]] や他の TSFM への影響が期待される設計上のレシピ。(Source: [[@2024__arXiv__Chronos Learning the Language of Time Series]])
- **スケーリング + 量子化によって回帰を分類として解く設計が確率的予測の柔軟性を提供する**: Chronos は時系列値を平均スケーリング後に均一量子化し($B=4096$ ビン)、クロスエントロピー損失で学習する。デコード時は複数トークン列を独立サンプリングし、その経験的分位数から任意の予測区間を構成する。これは正規化フローやスチューデント-T 混合(Toto 等)と異なり、分布の形状を仮定しない柔軟性を持つ。一方でオーバーフロー(値域外クリップ)と量子化誤差が精度の上限を制約する構造的トレードオフを内包する。詳細は [[時系列トークナイゼーション]] を参照。(Source: [[@2024__arXiv__Chronos Learning the Language of Time Series]])
- **スパース MoE が TSFM の Billion スケール化を実現する最初の手段として確立した**: Time-MoE([[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]])は、decoder-only トランスフォーマーの FFN を MoE 層(非共有エキスパート + 常時有効な共有エキスパート、Top-2 ルーティング)で置き換えることで、同一活性化パラメータ数の密モデルに対し訓練コスト **78% 削減**・推論コスト **39% 削減**でモデルを 2.4B パラメータへスケールアップした。ゼロショット MSE を最良ベースライン(Moirai-large)比 11%・Chronos-large 比 23%・Moment 比 30% 削減した。点予測系の目的関数(Huber 損失)と MoE を組み合わせることで、NLL/Cross-Entropy ベースの確率的 TSFM([[Toto]]/[[@2024__arXiv__Chronos Learning the Language of Time Series|Chronos]])とは別の計算効率路線を開いた。エキスパートの専門化可視化はドメイン間の知識分離を示唆し、MoE がアーキテクチャ上の疎性を通じて汎化に寄与する可能性を示す。(Source: [[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]])
- **Time-MoE の多解像度予測ヘッドが「可変ホライズン」という TSFM 設計の共通課題を点予測軸で解決した**: Time-MoE は複数ホライズン $\{1, 8, 32, 64\}$ への FFN ヘッドと貪欲スケジューリングで任意ホライズンを効率的に生成する。decoder-only + RoPE との組み合わせでコンテキスト長・予測長の両方で柔軟性を達成した。[[TimesFM]] の「出力パッチ長 > 入力パッチ長」・[[Toto]] の causal scaling と目的(可変ホライズン)は共通するがアプローチが異なり、多解像度 head + 貪欲スケジューリングという Time-MoE の解が MoE の追加設計コストを正当化するかは評価軸依存。(Source: [[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]], [[@2024__arXiv__A Decoder-Only Foundation Model for Time-Series Forecasting]])
- **Time-300B の偏りが汎用 vs ドメイン特化コーパス戦略の対比を明確化する**: Time-300B(309B 点)は Nature ドメイン(気象・気候系列)が 90.5% を占める不均一分布を持ち、ETT・Weather 等の標準ベンチでの強さに対応する。一方 [[Toto]]/[[BOOM]] が運用テレメトリ特化で汎用 TSFM を凌ぐのは、事前学習データの分布ミスマッチを正面から狙った戦略の成果。Time-300B は「大規模汎用コーパス(90% が自然系列)」であるのに対し BOOM は「小規模ドメイン特化コーパス(観測メトリクスのみ)」と対称的で、スケール × 汎用 vs 特化 × 小規模のトレードオフを体現する。(Source: [[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **NTP への汎用トークナイザが生成・分類まで統一する——UniTok / UniTok-FM が「訓練不要文脈内推論」を初めて実現**: [[@2026__arXiv__Time Series as Language - A Universal Tokenizer for General-Purpose Time Series Foundation Models]](Zhang+ 2026)は、VQ-VAE 系の汎用トークナイザ **UniTok** とその上に NTP で事前学習した **UniTok-FM** を提案した。Chronos が点単位の均一ビニングで NTP を行うのに対し、UniTok はプレフィックス正規化・漸進解像度因果エンコーダ・構造保持再構成損失の 3 要素で可変長・非有界時系列を離散トークンに変換し、Chronos より大幅に豊かな時間構造を捉える。UniTok-FM は同一モデルでゼロショット/プロンプト強化予測・少数ショット生成・少数ショット分類をすべて訓練不要文脈内推論で実現した最初の TSFM であり、この多タスク訓練不要推論は先行研究に前例がない。GIFT-Eval 予測で Chronos-Bolt と競合し、5 プロンプト例で Diffusion-TS(1000 サンプル訓練)と同等の生成品質を達成、UCR-FewShot 分類で UCR データなしに MOMENT と同等精度(Acc 0.755 vs 0.778)を示した。「豊かなトークナイザが TSFM の多タスク汎化を可能にする」という設計原理を実証した。(Source: [[@2026__arXiv__Time Series as Language - A Universal Tokenizer for General-Purpose Time Series Foundation Models]])
- **TSFM のクラスタリング性能は古典手法 k-Shape を統計的に上回れない——「予測以外のタスクでの TSFM の優位」は未確立**: Paparrizos+ 2025 の84手法ベンチマーク([[@2025__PVLDB__Time-Series Clustering - A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods]])は、CHRONOS・OFA・MOMENT の3基盤モデルを時系列クラスタリングで初めて体系的に評価し、いずれも10年前の k-Shape を Wilcoxon 検定・Friedman-Nemenyi 検定で統計的に上回れないことを示した。MOMENT は [[UCR Time Series Archive]] を事前学習に使用しておりデータ汚染を指摘された。TSFM は予測タスクでスケーリング則に従うことが Toto 2.0 で確認されたが、クラスタリング・分類等の下流タスクでは同じ優位が転移しない可能性がある。汎用 TSFM が「予測のみの専門家」に留まるのか、事前学習表現が他タスクにも有効なのかを切り分ける知見として重要。(Source: [[@2025__PVLDB__Time-Series Clustering - A Comprehensive Study of Data Mining, Machine Learning, and Deep Learning Methods]], [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]])
## 未解決の問い
- [[SPRINT]] のダウンサンプリング間隔 k = P/4 は実験で最良だが、どの TSFM・どのデータセットでも普遍的に最適か。高揮発性・低周期性の観測データ([[BOOM]] 系)では k の最適値がどう変わるか未検証。([[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]])
- 「精度と効率の同時改善」が成立する境界条件は何か。SPRINT は標準 LTSF データセット(ETT 系・Weather 等)で成立するが、急変動・非定常な観測テレメトリ([[Toto]]/[[BOOM]] の評価軸)でも同じ構造が機能するか。非周期株価データでの自動 k 選択(Section 7)と観測データへの展開は別問題。([[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- 観測データ特化の設計(causal scaling・factorized attention・Student-T mixture)は汎用ベンチマークでも効くと示されたが、逆に汎用 TSFM(Moirai・TimesFM・Chronos 等)が観測データで苦戦する根本原因はアーキテクチャか事前学習データの分布か。Toto は両方を変えているため切り分けが未解決。
- encoder-only([[Falcon-X]])と decoder-only([[Toto]]・Timer 系)のどちらが TSFM に適するか。Falcon-X は flexible context/horizon sampling で encoder-only の可変長制約に対処するが、両系統を同条件で比較した結果はまだない。
- 多変量モデリングの利得(Falcon-X が主張)と観測データ特化の利得([[Toto]] が主張)は独立か相補的か。両者を統合した TSFM の検証が未着手。
- TSFM にスケール情報を統合する最善の方法は何か。Mantis の NME(パッチの平均と標準偏差を表現に埋め込む)は効果的だが、Toto はスケール非依存でも観測データ特化の事前学習で高性能を達成する。スケールエンコードの設計空間(入力正規化+逆変換 vs. 明示的埋め込み vs. 事前学習データの多様性)の体系的比較が不在。([[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]])
- TSFM 共通の固定間隔時系列の仮定をどう外すか。欠損点へのネイティブ対応、不規則サンプリングへの拡張。
- カレンダー特徴・外生変数をゼロショット基盤モデルに組み込む方法。
- 観測データ予測の精度向上は、下流の[[異常検知 - MOC|異常検知]]・キャパシティプランニング・[[障害予測]]にどの程度寄与するか(本論文は予測精度のみを評価し下流タスクは未検証)。
- [[エージェント型時系列予測]]が主張する「TSFM はモデル規模と直交し ATSF の 1 ツールに過ぎない」という位置づけは、TSFM 側の進歩(精度・汎化・スケール情報の保持)とどう相互作用するか。高精度な TSFM ほどエージェント的な省察・再計画の余地が小さくなるのか、それとも良い predictive tool が ATSF 全体の性能を底上げするのか、両者を組み合わせた検証が未着手。[[Cast-R1]] のツールアブレーション([[Chronos-2]] 除去で volatile NP が 22.5→55.4)は「良い predictive tool が ATSF 全体を底上げする」方向の部分証拠を与えたが、逆方向(高精度 TSFM が省察余地を縮める)は依然未検証。([[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]], [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]])
- ベンチマークのデータ leakage 問題(GIFT-Eval で一部競合に既知の leakage)を、運用テレメトリ由来の評価データでどこまで厳密に排除できるか。
- 異種 TSFM のアンサンブル([[TimeCopilot]] の MedianEnsemble + isotonic regression が [[Chronos-2]]+[[TimesFM]]+[[TiRex]] を結合し単体 SOTA を上回る)で、どのモデルの組合せ・結合手法が最適か。また汎用 GIFT-Eval で得たアンサンブル利得が、観測テレメトリドメイン([[Toto]]/[[BOOM]] の評価軸)でも同様に出るかは未検証。([[@2025__arXiv__TimeCopilot]])
- 多解像度入力([[@2025__arXiv__Cisco Time Series Model Technical Report]])と観測データ特化([[Toto]])と多変量化([[Falcon-X]])の 3 つの利得は独立か相補的か。Cisco TSM は単変量・固定解像度比(60)・2 解像度に限られ、3 解像度以上や可変配置(特殊トークンの固定配置の硬直性)は未着手と自認する。
- 特殊トークン(ST)単独・解像度埋め込み(RE)単独のアブレーションが説明のつかない数値的不整合を示しデータ規模で結論が変わった([[@2025__arXiv__Cisco Time Series Model Technical Report]] 表7・表8)。少数パラメータの新規構造がなぜ大規模に不安定なのか、その機序は未解明。
- 多解像度の長コンテキストでも late-breaking change(急変動)・高揮発性・短コンテキストの系列で予測が劣化する([[@2025__arXiv__Cisco Time Series Model Technical Report]] 図9・図13)。コンテキスト長を増やしても解けない「信号の内在的複雑さ」に起因する限界をどう扱うか。
- TSFM にスケール情報を統合する最善の方法は何か。Mantis の NME(パッチの平均と標準偏差を表現に埋め込む)は効果的だが、Toto はスケール非依存でも観測データ特化の事前学習で高性能を達成する。スケールエンコードの設計空間(入力正規化+逆変換 vs. 明示的埋め込み vs. 事前学習データの多様性)の体系的比較が不在。([[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]])
- 研究室環境の単一基地局・少数 UE から収集した [[TelecomTS]] が、本番通信ネットワーク(数千基地局・数百万ユーザー)のオブザーバビリティをどこまで代表するか。BOOM(Datadog の実運用データ)と TelecomTS(研究室構築)の汎化性の比較が未検証。([[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]])
- サーベイ [[@2025__arXiv__Foundation Models for Time Series - A Survey]] が将来課題に挙げた汎用的トレードオフ(モデル規模と計算効率・長期依存・解釈性・データ効率)は、observability 特化 TSFM([[Toto]]/Cisco TSM)では優先順位がどう変わるか。サーベイは汎用視点で観測ドメインでの重み付けを論じない。
- 汎ドメイン TSFM の性能飽和と実務乖離が「和解不能」であるなら([[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]])、観測データ特化の TSFM([[Toto]]/[[BOOM]]・Cisco TSM)はこの批判を回避しているのか、それとも観測ドメイン内でも同じ飽和に向かうのか。ドメイン特化 TSFM のスケーリング限界の検証が未着手。
- サーベイの 6 軸(アーキテクチャ/パッチ/目的関数/単変量・多変量/確率的・決定論的/規模)のうち、観測データ性能を最も左右するのはどれか。[[TelecomTS]] はスケール情報の保持を、[[Toto]] は事前学習データの分布を決定要因とするが、サーベイの分類軸との対応(例: 目的関数が NLL=確率的であることが観測異常検知に効くか)は未整理。
- [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]] の協調的 fine-tuning 3 階層(PLC / MLC / HLC)で観測テレメトリドメインに最も効くのはどの層か。LoRA(PLC)・CLIP 流多モーダル(MLC)・KD(HLC)を [[Toto]] や [[@2025__arXiv__Cisco Time Series Model Technical Report|Cisco TSM]] のような観測特化 TSFM 上で同条件比較した研究は未発表。サーベイ自体が観測ドメインを扱わないため、本 wiki が今後追跡すべき軸。
- 推論駆動型 RL(GRPO + chain-of-thought)が TSFM の実用性能を底上げするのか、それとも reasoning trace 生成のオーバーヘッドが推論コストを実用範囲外に押し上げるのか。サーベイは reasoning-driven RL を「萌芽期」と位置づけるのみで、Time-MoE / Sundial / Chronos-2 等の単一順伝播 TSFM との実測比較は未着手。
- 不規則時系列(MIMIC・PhysioNet 系)で事前学習された TSFM の知識は、規則的観測テレメトリ(Datadog BOOM・Cisco)へどう転移するか。「不規則対応 TSFM」と「観測特化 TSFM」が将来統合されるか、それとも医療系と運用系で別系統が並走するかは未検証。(Source: [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]])
- [[Chronos-2]] が多変量タスクで示した「univar モードでも Toto-1.0 を上回る」という結果は、Takens 定理に基づく解釈を支持するが、この現象がどのコンテキスト長・変量数・依存構造の条件で成立するか未検証。観測テレメトリ(短い履歴・高揮発性)では Takens 仮説が崩れ ICL ゲインが回復するのか。([[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- Chronos-2 の合成データ戦略(Multivariatizer)は「実世界の多変量データ不足を回避した」が、合成依存関係と実世界の複雑な多変量依存(非線形・長距離・スパース)の乖離が性能上限を制限しているか。Chronos-2-Synth(合成データのみ)と Chronos-2 本体の差がどのデータセット属性で最大化するかは未整理。([[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- Group Attention の positional embedding なしという設計は、グループ内の「順序なし集合」として系列を扱うことを意味するが、依存関係に方向性(リードラグ)があるケースで情報が十分に伝わるのか。Sequential Multivariatizer が時間をまたぐ依存を付加した訓練データと実推論でのグループ構成が異なる場合の汎化は未検証。([[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- Chronos-2 は fev-bench・GIFT-Eval・Chronos Benchmark II の 3 ベンチで SOTA だが、BOOM(Datadog 観測メトリクス)での性能は未評価。観測データ特化 TSFM([[Toto]]/[[BOOM]])が Chronos-2 の汎用 ICL を上回るか、それとも共変量付き ICL が観測ドメインの検知・予測に新しい価値をもたらすかが未検証。([[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- スパース MoE(Time-MoE)の訓練コスト 78% 削減は Toto 2.0 が u-μP + NorMuon で追求した効率化と異なる路線だが、両者を同一評価軸(BOOM など)で比較した結果は未公開。ドメイン特化(Toto)× スパース MoE(Time-MoE)を統合したモデルはスケーリング効率と精度の両方を達成できるか。([[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]], [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]])
- Time-MoE のエキスパート専門化(異なるデータセットで異なるエキスパートが活性化)は MoE の表現多様性の証拠として示されるが、どのエキスパートが何を学んでいるか(ドメイン別・周波数別・トレンド別)の解釈は未着手。スパース TSFM の解釈可能性は密モデルより高いか低いか。([[@2025__ICLR__Time-MoE - Billion-Scale Time Series Foundation Models with Mixture of Experts]])
## 関連
- 概念: [[多変量時系列予測]] / [[異常検知]] / [[AIOps]] / [[障害予測]] / [[エージェント型時系列予測]] / [[Mixture-of-Experts]]
- ソース: [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] / [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]] / [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models]] / [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]] / [[@2025__arXiv__Cisco Time Series Model Technical Report]] / [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]] / [[@2025__arXiv__Foundation Models for Time Series - A Survey]] / [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]] / [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]]
- エンティティ: [[Toto]] / [[BOOM]] / [[Datadog]] / [[Carnegie Mellon University]] / [[Falcon-X]] / [[Ant International]] / [[Chronos-2]] / [[TimesFM]] / [[TiRex]] / [[Cisco]] / [[Splunk]] / [[GIFT-Eval]] / [[fev-bench]] / [[TelecomTS]] / [[Yale University]] / [[Cast-R1]] / [[TimeCopilot]] / [[Dell Technologies]] / [[Siva Rama Krishna Kottapalli]] / [[SPRINT]] / [[Longlong Xu]] / [[Dan Pei]] / [[Tsinghua University]] / [[Qinwei Ma]] / [[Princeton University]] / [[Abdul Fatir Ansari]] / [[Oleksandr Shchur]] / [[Yuyang Wang]] / [[Amazon Web Services]] / [[Azul Garza]] / [[Cristian Challu]] / [[Max Mergenthaler-Canseco]] / [[Nixtla]]
- 関連 MOC: [[時系列基盤モデル - MOC]] / [[異常検知 - MOC]] / [[Telemetry - MOC]]
## 出典
- [[@2023__arXiv__TimeGPT-1]](§5 アーキテクチャ・事前学習・コンフォーマル予測、§6 Table 1 ゼロショット評価・推論速度比較)
- [[@2026__arXiv__Toto 2.0 - Time Series Forecasting Enters the Scaling Era]](Toto 2.0 arXiv 版、スケーリング則初確立・NorMuon・CPM・u-μP)
- [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]](Toto 2.0 ブログ版、arXiv:2605.20119)
- [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]]
- [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]]
- [[@2025__CSUR__A Survey of AIOps in the Era of Large Language Models]](§5.1 Foundation Model: 時系列基盤モデルの AIOps 応用)
- [[@2026__ICML__TelecomTS - A Multi-Modal Observability Dataset for Time Series and Language Analysis]](Table 2/4/7: TSFM の観測データ性能とスケールアブレーション)
- [[@2026__arXiv__Position Beyond Model-Centric Prediction - Agentic Time Series Forecasting]](§2 Table 1: Foundation Models を含む予測パラダイム進化表、§5: ATSF はモデル規模と直交)
- [[@2025__arXiv__Cisco Time Series Model Technical Report]](§2 多解像度アーキテクチャ、§3 観測ドメインのデータ操作原則、§4 GIFT-Eval/観測データ評価)
- [[@2026__arXiv__Cast-R1 - Learning Tool-Augmented Sequential Decision Policies for Time Series Forecasting]](§3.3 予測モデルツール化、§4.3.1 Table 3 コンポーネントアブレーション、§4.4 Table 12 個別予測モデルツールのアブレーション)
- [[@2025__arXiv__Foundation Models for Time Series - A Survey]](§3–§4: 6 次元タクソノミー、Table 2: モデル比較、§5 ISSUES: 各モデルの限界)
- [[@2025__arXiv__TimeCopilot]](§2.2 TSFM 統一ハブ、§3.1 GIFT-Eval/MedianEnsemble、Figure 2 CRPS/MASE ランク)
- [[@2026__ICML__See More, Forecast Better and Faster - Enhancing Time Series Foundation Models via Inference-Time Plug-and-Play Downsampling]](Table 1/2: 精度・効率改善、Table 3: コンポーネント検証、Section 5–6: アブレーション)
- [[@2026__arXiv__Position - The Inevitable End of One-Architecture-Fits-All-Domains in Time Series Forecasting]](§3: 和解不能な矛盾の論証、§4: ベンチマーク飽和と実務乖離、Table 1–2: コンペ・ドメイン論文調査)
- [[@2026__techRxiv__From Pre-training to Post-training - A Survey on Time Series Foundation Models]](§III 3 次元タクソノミー、§IV データセット、§V 事前学習、§VI 事後学習(SFT/PEFT/協調 PLC-MLC-HLC/強化 reasoning-非 reasoning)、§VII 将来方向、Table I-VI)
- [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]](group attention + Multivariatizer で単変量・多変量・共変量付き予測を統一、fev-bench/GIFT-Eval/Chronos Benchmark II 全 SOTA)
- [[@2024__arXiv__Chronos Learning the Language of Time Series]](§3 スケーリング+量子化トークン化、§4 TSMixup・KernelSynth、§5 Benchmark I/II、§5.5 初期化アブレーション)