# 多変量時系列予測
## 定義
多変量時系列予測(multivariate time series forecasting / cross-variate modeling)は、複数の変量(チャネル)が共進化する時系列を、変量間の依存関係を活用して同時に予測するタスク。単変量予測が各系列を自身の履歴のみから外挿するのに対し、実システムに遍在する変量間の相乗的・拮抗的な相互作用を捉えることを狙う。[[時系列基盤モデル]](TSFM)の文脈では、可変な変量数を単一の事前学習モデルで扱えることが要件になる。([[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
## 横断的知見
- TSFM の cross-variate 実現方式は段階的に分化している: Moirai 1.0=系列の flatten/concat、[[Toto]]=proportional factorized space-time attention(time:variate≒11:1 の固定比)、[[Chronos-2]]=group attention(group mixing)、[[Falcon-X]]=latent prototype routing。Falcon-X はこのうち flatten/factorized/group をまとめて「生の変量空間での相互作用」と捉え、異種物理量の意味的なアライメント機構の欠如と関係表現力の不足を批判する。(Source: [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- 標準の softmax attention はスコアが非負([0,1])のため拮抗的(負相関)な依存を明示できない。Falcon-X は Differential Transformer の差分機構を転用し正負の prototype Kpos/Kneg で符号付きの依存を表現する。Toto・Chronos-2 を含む既存手法はこの「負の依存」を構造的に持たない(Falcon-X 表1)。(Source: [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- 観測・運用系(observability/CloudOps)の多変量は高次元になりやすい。[[BOOM]] は系列あたり変量数の中央値が 60、Falcon-X が評価に使う [[fev-bench]] の BOOMLET 系列も変量数 21〜100。両ソースとも cloud/運用テレメトリの高次元多変量を主要な対象として重視する点が一致する。(Source: [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- 評価基盤は GIFT-Eval を共通軸に収斂しつつある。Datadog が公開した観測特化のベンチマーク [[BOOM]] は、その部分集合 BOOMLET として他者の [[fev-bench]] に組み込まれ、第三者モデル(Falcon-X)の多変量評価に使われ始めている。(Source: [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **「多変量対応」の分類基準がソース間で食い違う**: TSFM サーベイ [[@2025__arXiv__Foundation Models for Time Series - A Survey]] は out of the box の多変量対応で 15 モデルを二分し、AutoTimes・Time-LLM・FPT を「各チャネルを独立処理する(channel independence)」ことで多変量対応とカウントする。一方 [[Falcon-X]] はまさにこの channel independence を「cross-variate 相互作用が単変量的に退化する」として真の多変量モデリングから除外する。同じモデルが「多変量対応(サーベイ)」と「変量間モデリング不在(Falcon-X)」に分かれうる——多変量 TSFM を評価するときは「複数系列を入力できる」のか「変量間依存を学習する」のかを区別する必要がある。(Source: [[@2025__arXiv__Foundation Models for Time Series - A Survey]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **初期 TSFM は単変量が多く、多変量対応は後発・MoE 系・LLM 適応系に偏る**: サーベイの分類では TimeGPT・Chronos(初代)・Lag-Llama・TimesFM・MOMENT・Timer が単変量、Time-MOE([[Mixture-of-Experts]])・Timer-XL・[[Toto]]・MOIRAI・AutoTimes・Time-LLM・TTM が両対応。vault が個別に追ってきた多変量 TSFM([[Toto]]/[[Chronos-2]]/[[Falcon-X]])はいずれも 2024 年後半以降で、多変量化が TSFM の比較的新しい主戦場であることが時系列的にも裏づけられる。(Source: [[@2025__arXiv__Foundation Models for Time Series - A Survey]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **PromptCast による多変量の「分割テンプレート」アプローチ**: [[@2022__arXiv__PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting]] は多変量 PromptCast の pilot study で Prompt C(各変量を独立した質問として分割)が Prompt A/B(全変量を 1 文に混在)を一貫して上回ることを示した。これは Falcon-X が批判する「channel independence = 変量間情報喪失」のトレードオフを、プロンプト設計の文脈で異なる角度から裏付ける。(Source: [[@2022__arXiv__PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting]])
- **Chronos-2 の group attention は多変量の「意味的崩壊」批判(Falcon-X)と共変量付き ICL 効果(Chronos-2 一次出典)の間に矛盾がある**: [[Falcon-X]] は group attention の有無で GIFT-Eval 性能がほぼ変わらないことを示し「raw-space の変量混合が意味的崩壊を引き起こす」と批判する。一方 [[Chronos-2]] の一次出典([[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])は fev-bench の共変量付き 42 タスクで ICL 有無の差(Skill Score 39.9→47.0)を示す。両者の評価タスクが異なる点に注意が必要で、Falcon-X の批判は**多変量ターゲット予測**でのゲイン不在を指摘し、Chronos-2 の利得は**将来既知共変量**という非対称情報の活用から来る。多変量ターゲット予測での group attention のゲイン不在はむしろ Takens 定理で解釈され、「raw-space 混合の限界」とは異なる理由を持つ。
> [!contradiction] Falcon-X(group attention の意味的崩壊批判)と Chronos-2(共変量付き ICL の大幅ゲイン)が矛盾するように見えるが、批判対象のタスクが異なる(多変量ターゲット予測 vs 共変量付き予測)。同条件での比較が未実施のため決着は未定。
(Source: [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]], [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- **Multivariatizer という合成多変量データ生成が実世界データ不要で多変量 ICL を付与した**: [[Chronos-2]] は実世界の多変量データをほぼ使わず、Cotemporaneous Multivariatizer(瞬時線形/非線形変換)と Sequential Multivariatizer(リードラグ・共和分)の 2 種の合成器で単変量生成器(AR・ETS・TSI・KernelSynth)の出力に依存構造を付加する。これは「多変量事前学習データの不足」という TSFM の構造的課題を正面から回避する最初の本格的手法。[[Falcon-X]] も大量の実世界多変量データ(cloud trace 等)を事前学習に使う路線と対照的で、「合成データで ICL を付与する」vs「実データで表現を学ぶ」という多変量化の 2 路線が出現した。(Source: [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **cross-variate 機構の系譜に、Moirai の flatten/concat より前の「両軸独立 self-attention」という初期形態が存在する**: [[UniTS]]([[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]]、NeurIPS 2024)は、時間方向の Time MHSA と変量方向の Variable MHSA を直列に適用する設計で、既存の PatchTST(時間方向のみ)・iTransformer(変量方向のみ)がいずれか片方にしか自己注意を適用しない点を明示的な課題として指摘する。Variable MHSA は計算量削減のため Q・K を時間方向で平均した共有 $\hat{Q}, \hat{K}$ を用いており(式8)、Falcon-X が批判する「生の変量空間での相互作用」に分類される素朴な方式だが、Moirai の flatten/concat・Toto の factorized attention・Chronos-2 の group attention のいずれとも異なる「両軸を明示的に分離した独立 self-attention の直列適用」という設計は、cross-variate 機構の分化(§40行目)にもう1つの初期分岐を加える。UniTS は変量数 1〜963 という広いレンジのデータセットで単一モデルとして機能することを実証しており、変量数の異種性への対応という観点では Falcon-X が指摘する「異種物理量の意味的アライメント機構」の欠如を、明示的な意味的アライメントなしに(タスク・データセットごとのprompt tokenで)緩和している可能性がある。(Source: [[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **cross-variate 機構の系譜に、クロネッカー積による因果マスクの明示的分解という decoder-only 固有の形態が加わる**: [[Timer-XL]]([[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]]、ICLR 2025)は、変量依存グラフの隣接行列 $C$ と時間的因果マスク $\mathcal{T}$ のクロネッカー積 $C \otimes \mathcal{T}$ でトークン間依存を厳密に分解する TimeAttention を提案した。UniTS の Time/Variable MHSA の直列適用、Moirai の flatten/concat、Toto の factorized attention、Chronos-2 の group attention がいずれも encoder-only または位置エンコーディング非依存の設計であるのに対し、Timer-XL はRoPE(時間方向)+ 学習可能スカラー(変量方向、内生/外生の区別)を組み合わせた **decoder-only の causal cross-variate attention** という新しい設計点を示す。著者らは encoder-only(UniTST)が長コンテキストで性能劣化する現象を実証し(ERA5 の年次コンテキストで PatchTST の MSE が 0.0745→0.1194 へ悪化)、decoder-only の causality 維持がこれを緩和すると報告しており、cross-variate モデリングの設計選択(encoder-only vs decoder-only)が長コンテキストへのスケーラビリティを左右するという具体的証拠を Falcon-X/Toto の一般的観察に追加する。(Source: [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]], [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]])
- **共変量付き予測でも「非対称な変量依存行列」という設計で causality の効果を単独検証した最初の直接比較**: Timer-XL は EPF(電力価格予測)で目的変量→共変量の非対称な依存を $C$ として明示的に定義し、時間マスクを維持する causal 版と全1行列に置換した noncausal 版を同一アーキテクチャ・同一データで比較した(Table 6)。結果は一貫して causal 版が優れており(Average MSE 0.302 vs 0.316)、「次トークン予測における causality の維持が性能上限を高める」という単変量での知見が、変量間依存にも同様に成り立つことを Ablation として直接示した。Chronos-2 の Group Attention は位置埋め込みを持たず順序なし集合として変量を扱う設計であり(§未解決の問い参照)、Timer-XL の結果は「変量間の順序・因果性を明示的にモデル化する方が良い」という対照的な設計思想を裏付ける一次証拠となる。(Source: [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]])
- **cross-variate 機構の系譜に、事前学習ではチャネル独立・fine-tuning でのみチャネル混合を有効化する「二段階切替」という設計が加わる**: vault はこれまで Moirai の flatten/concat・Toto の factorized attention・Chronos-2 の group attention・Falcon-X の latent prototype routing・UniTS の Time/Variable MHSA 直列適用・Timer-XL のクロネッカー積分解という、いずれも事前学習時から変量間相互作用を組み込む設計を観察してきた。これに対し [[Tiny Time Mixers (TTM)]]([[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]])は、backbone を一貫してチャネル独立に事前学習し(多様な変量数を持つ事前学習データセット群を扱うための設計上の妥協)、fine-tuning 時にのみ decoder の channel-mixing ブロックを有効化してターゲットドメインのチャネル相関を後付けで学習する。D2 データセット(Bike Sharing・Carbon Capture・Application・Service)での実験(Table 6)では、この channel-mixing 版(TTM-CM)が TSMixer-CM・TSMixer-CC・PatchTST・GPT4TS を 15〜44% 上回った。「事前学習段階でどこまで変量間相互作用を作り込むか」という設計軸に、TTM は「事前学習では作り込まず、ターゲットドメイン適応時にのみ軽量な decoder で追加する」という最小主義的な選択肢を提示する。(Source: [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- **外生変数(exogenous variables)の後付け注入という、他の cross-variate 機構が正面から扱わない要件に、専用の exogenous mixer で対応する**: Falcon-X・Chronos-2・Toto が主に「目標変数間の相互依存」を競う一方、TTM は「将来値が既知の外生変数をどう目標予測に組み込むか」という実務上重要な別要件に、予測 head 出力の外生チャネルを既知の真値で置換したのち stride=1 のラグ窓パッチングで channel-mixing TSMixer block に通す専用機構(exogenous mixer)で応える。Chronos-2 の共変量付き ICL(Multivariatizer による合成データ由来)と機能的には近いが、TTM は合成データでなく実データ(Bike Sharing の天候変数等)への直接 fine-tuning で外生変数の寄与を学習する点で経路が異なる。(Source: [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]], [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- **TTM の「事前学習ではチャネル独立、fine-tuning でのみチャネル混合」という二段階切替に先行する形態として、[[AutoMixer]] は「事前学習ではチャネルを圧縮、fine-tuning で圧縮チャネル空間ごと TSMixer backbone に通す」という別の二段階設計を提示していた**: 同じ著者陣([[Vijay Ekambaram]] ほか、IBM Research + IIT Bombay)による AutoMixer(IAAI-24)は、RNN ベース AutoEncoder でチャネル数 $C$ を $C' < C$ に圧縮する事前学習を行い、その Encoder/Decoder 重みを転用して [[TSMixer]] backbone を end-to-end 微調整する。TTM が「チャネル独立 backbone を保ったまま fine-tuning 時にのみ channel-mixing decoder を後付けする」のに対し、AutoMixer は「チャネル数そのものを圧縮してノイズの多いチャネル間相互作用を事前に間引いてから TSMixer に渡す」という異なる経路をとる。いずれも「事前学習段階でチャネル間相互作用をどこまで作り込むか」という同じ設計軸上の選択肢であり、TTM の「後付けで軽量に追加する」という最小主義的立場に対し、AutoMixer は「事前学習の時点でチャネル空間自体を圧縮・整理する」というより早い段階での介入を選ぶ。BizITObs(ビジネス KPI + IT イベント)という、意味のある相関とノイズの多い相関が混在するドメイン特有の課題に対応するための設計と位置づけられる。(Source: [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]], [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]])
- **多変量構造がモデル容量の代替になることを、同一アーキテクチャの 2×2(サイズ×モダリティ)アブレーションで直接分離した実証例**: [[@2026__arXiv__APEX - A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations|APEX]] は同一の decoder-only transformer を APEX-Large/APEX-Edge(269M/10.5M)× 1D(単変量)/multi(10チャネル多変量)の4通りで学習し、多変量モードが単変量モードを一貫して上回ることを示す。特に APEX-Edge(multi)は APEX-Edge(1D)比で MAE を 3.87 対 4.78 まで改善し、26倍大きい [[Toto]](MAE 3.64)に匹敵する精度をわずか10.5Mパラメータで達成する一方、APEX-Edge(1D)は SARIMA 相当まで性能が落ちる。多変量の因果連鎖入力(DHCP プロトコルの目標5変数+外生5変数)が、単なるモデル容量の不足を補う具体的な enabler として機能した定量例であり、Falcon-X が指摘する「初期 TSFM の多くは channel independence で単変量に閉じていた」という限界を、パラメータを増やさず構造の choice だけで克服する経路を示す。(Source: [[@2026__arXiv__APEX - A Network-Native Time-Series Foundation Model for Forecasting and Anomaly Detection for Wireless Edge Operations]])
- TSFM の後学習で提示された共変量注入、チャネル間適応、入力変換を、同一ベンチマークと計算予算で比較したとき、どの介入位置が多変量依存を最も効率よく獲得するか。([[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 4 Parameter Adaptation Methods]], [[@2026__arXiv__Post-Training in Time Series Foundation Models A Unifying Framework - Chapter 5 Context Augmentation Methods]])
- TimesFM の第3世代(TimesFM-3, 2026-08)は複数ターゲット・過去共変量・過去-未来共変量の3種の共変量をゼロショットでネイティブに扱う初の TimesFM 世代であり、[[時間-変量交互アテンション]](causal temporal attention と full variate attention の交互積層)で系列間相関を学習する。GIFT-Eval・FEV-Bench・Time leaderboard の3ベンチマーク全てで multivariate モードが univariate モードを上回り最高順位を獲得した(Source: [[@2026__Google Research Blog__TimesFM-3 - A Zero-Shot Foundation Model for Multivariate Forecasting]])
## 未解決の問い
- クロネッカー積による明示的な変量依存分解(Timer-XL の TimeAttention)は、BOOM 級の高次元観測多変量(変量数 60 以上)でも $C \in \mathbb{R}^{N \times N}$ の構築・計算コストが実用的か。Timer-XL の実験は最大 862 変量(Traffic)・4920 局(ERA5-Large)で FlashAttention 併用により $O(NT)$ メモリを達成しているが、Falcon-X/Chronos-2 が想定する異種物理量混在の観測ドメインでの直接評価は未実施。([[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- Timer-XL が示した「共変量への causality 維持が性能を高める」という知見は、Chronos-2 の position-embedding なし Group Attention(順序なし集合として変量を扱う設計)にも当てはまるか。両者を同一ベンチマークで比較した研究は未着手。([[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]], [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- 「生空間での mixing は cross-variate 相互作用が単変量的に退化する(semantic collapse)」という Falcon-X の主張は、直接の検証が [[Chronos-2]] の group attention に対してのみ行われている。[[Toto]] の factorized attention や Moirai の flatten でも同じ退化が起きるのかは未検証。
- latent prototype routing は高次元の観測多変量(BOOM 級、変量数 60 以上)で実際に利得を出すか。Falcon-X の cloud ドメイン評価は BOOMLET・Redset 等を含むが、観測ドメイン単独での分解結果は未報告。
- cross-variate モデリングの予測精度向上は、下流の SRE タスク([[異常検知]]・[[障害予測]]・キャパシティプランニング)にどの程度伝播するか。両ソースとも予測精度のみを評価。
- 変量順序のシャッフル(permutation invariance)が内容駆動の依存学習に重要との知見(Falcon-X のアブレーション、Xu+ 2026)は、どの cross-variate 方式でも一般に成り立つのか。
- サーベイが「多変量対応」とする channel-independent モデル(AutoTimes/Time-LLM/FPT)は、真の cross-variate 機構を持つモデル([[Falcon-X]] の prototype routing・[[Chronos-2]] の group attention)と下流性能でどれだけ差がつくか。分類上は同じ「多変量」でも機構が異なり、同条件比較がない。
- Chronos-2 の合成データ(Multivariatizer)で付与された多変量 ICL 能力は、実世界の複雑な依存(非線形・長距離・スパース・ノイズ混入)を持つ多変量系列でどこまで一般化するか。BOOMLET や Redset(Chronos-2 が評価した fev-bench の構成データ)以外の観測テレメトリドメインでは未検証。
- Group Attention を「任意のグループ内で情報共有する汎用 ICL 機構」として捉えたとき、グループ定義を「時系列リスト以外の情報源(テキストメタデータ・グラフ隣接・時刻情報)」へ拡張できるか。Chronos-2 はテキストや密な埋め込みによるグループ形成(検索拡張予測)を将来方向として言及するが未実装。([[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]])
- UniTS の Time MHSA + Variable MHSA という「両軸独立 self-attention の直列適用」は、Falcon-X が主張する「生の変量空間での相互作用は意味的崩壊を起こす」という批判の対象になるのか。UniTS は変量数 1〜963 という広いレンジで単一モデルとして機能することを実証しているが、直接の比較(同一ベンチマーク上での UniTS vs Falcon-X vs Chronos-2)は未実施。([[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- TTM の「事前学習ではチャネル独立、fine-tuning でのみチャネル混合」という二段階切替は、事前学習からチャネル間相互作用を組み込む Falcon-X・Chronos-2 と比べて表現力の上限は劣るはずだが、D2(BS・CC・APP・SER)という比較的小規模・低次元なデータセットでの評価に限られる。BOOM 級の高次元(変量数 60 以上)観測テレメトリでも TTM-CM の「後付けチャネル混合」が Falcon-X の prototype routing・Chronos-2 の group attention に匹敵する性能を出せるかは未検証。([[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]], [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]])
- AutoMixer の「事前学習時点でチャネル空間を圧縮する」アプローチと TTM の「fine-tuning 時にのみ channel-mixing を後付けする」アプローチのどちらが、BOOM 級の高次元・異種物理量混在データでより頑健か。両者とも評価は比較的小規模・低次元(AutoMixer は最大 107 チャネル、TTM の D2 は 4 データセット)に留まり、直接比較や高次元観測データでの検証は未実施。([[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]], [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]])
- TimesFM-3 の full variate attention(全変量総当たり)の変量数スケーラビリティと、Chronos-2 の raw-space 変量混合・[[時系列基盤モデル]] で言及される Group Attention 系手法との精度・効率トレードオフの直接比較は一次ソースに無い
## 関連
- 概念: [[時系列基盤モデル]] / [[Mixture-of-Experts]] / [[時間-変量交互アテンション]]
- エンティティ: [[Falcon-X]] / [[Chronos-2]] / [[Toto]] / [[TimesFM]] / [[GIFT-Eval]] / [[fev-bench]] / [[BOOM]] / [[Dell Technologies]] / [[UniTS]] / [[Tsinghua University]] / [[Tiny Time Mixers (TTM)]] / [[IBM Research]] / [[AutoMixer]] / [[TSMixer]]
- ソース: [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]] / [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] / [[@2025__arXiv__Foundation Models for Time Series - A Survey]] / [[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]] / [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]] / [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]] / [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]] / [[@2026__Google Research Blog__TimesFM-3 - A Zero-Shot Foundation Model for Multivariate Forecasting]]
- 関連 MOC: [[時系列基盤モデル - MOC]]
## 出典
- [[@2025__arXiv__Chronos-2 - From Univariate to Universal Forecasting]](group attention + Multivariatizer、$O(V)$ スケーリング、共変量付き ICL 効果)
- [[@2026__arXiv__Falcon-X - A Time Series Foundation Model for Heterogeneous Multivariate Modeling]]
- [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]]
- [[@2025__arXiv__Foundation Models for Time Series - A Survey]](§3.2.4/§4.4: 単変量/多変量の分類)
- [[@2022__arXiv__PromptCast - A New Prompt-based Learning Paradigm for Time Series Forecasting]](§IV-I: 多変量 PromptCast pilot)
- [[@2024__NeurIPS__UniTS - A Unified Multi-Task Time Series Model]](§4.2 Time/Variable MHSA、Table 22 アブレーション)
- [[@2025__ICLR__Timer-XL - Long-Context Transformers for Unified Time Series Forecasting]](§3 TimeAttention・クロネッカー積による依存分解、Table 6 causal/noncausal共変量アブレーション)
- [[@2024__arXiv__Tiny Time Mixers (TTMs) - Fast Pre-trained Models for Enhanced Zero Few-Shot Forecasting of Multivariate Time Series]](§2.1 multi-level modeling、§3.2 exogenous mixer、§4.6 Table 6 チャネル混合・外生変数のD2評価)
- [[@2023__arXiv__AutoMixer for Improved Multivariate Time-Series Forecasting on Business and IT Observability Data]](§2.3 チャネル圧縮事前学習、§2.4 end-to-end 微調整、Table 2-5 BizITObs 評価)