[[National University of Defense Technology]] の Wang らが提案した、KPI 多変量時系列異常検知向けモデル([[@2024__OJCS__Large Pretrained Foundation Model for Key Performance Indicator Multivariate Time Series Anomaly Detection]])。コンピュータビジョン向けに事前学習済みの [[Vision Transformer]](ViT-B/16)のTransformerエンコーダー部分を凍結したまま流用し、(1) パッチ操作による時系列のトークン化、(2) 次元ごとに独立な線形特徴抽出ヘッド+共有バックボーンによるチャネル独立処理、(3) 時間領域パッチへの周波数領域(FFT振幅)パッチの連結、という3つの技術で構成される。訓練損失に MAE、テスト時の異常スコアに MSE を用いる再構成ベースの手法。
論文本文中では計算量比較の Table 9 でのみ「ViTAD」という表記も使われており、同一モデルを指す表記揺れがある。
## 性能
SMD・PSM・MSL・SMAP・SWaT の5標準ベンチマークと NIPS-TS-SWAN・NIPS-TS-GECCO の2追加データセットで、17個のベースラインモデル(OCSVM・IForest・Deep-SVDD・THOC・ITAD・LOF・MPPCACD・DAGMM・VAR・LSTM・CL-MPPCA・LSTM-VAE・OmniAnomaly・BeatGAN・InterFusion・[[Anomaly Transformer]]・DCdetector)と比較し、PSM・SWaTでF1最高、SMD・MSL・SMAPで2位、NIPS-TS系2データセットでは全ベースラインを上回った。詳細は [[@2024__OJCS__Large Pretrained Foundation Model for Key Performance Indicator Multivariate Time Series Anomaly Detection]] を参照。