# 時系列類似度検索
## 定義
時系列類似度検索(time series similarity search)は、クエリ時系列と形状が類似した部分系列や時系列を、大規模な時系列コレクションから効率的に発見するタスクである。運用監視の文脈では、異常が検知された時系列と過去の障害パターンや他のメトリクスとを照合することで、根本原因の候補を絞り込む用途に使われる。全対全比較は $O(n^2)$ の計算量になるため、フィンガープリントや近似手法で探索空間を絞ることが実用化の鍵となる。([[@2015__SREcon15 Europe__Signatures, Patterns, and Trends - Timeseries Data Mining at Etsy]])
主なアプローチ:
- **特徴量変換ベース**: 時系列を特徴ベクトル(形状記述アルファベット、SAX、傾きトークン等)に変換し、転置インデックスや近似最近傍探索で類似候補を絞り込む
- **動的時間伸縮(DTW)ベース**: 位相ずれに対して不変な距離尺度で全対全比較するが計算コストが高い
- **埋め込みベース**: 深層学習で時系列を低次元ベクトルに変換し、ベクトルデータベースで近似最近傍検索を行う(近年の傾向)
学術文献では同じ問題設定が Time Series Retrieval(TSR)とも呼ばれる。クエリ時系列に対し候補プール $C(q)$(関連集合 $P(q)$ とディストラクタ集合 $D(q)$ の非交和)からランキングを構成するタスクとして定式化され、根本原因分析(RCA)における異常系列の検索もこの枠組みに含まれる。([[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]])
## 横断的知見
- **多目標(multitarget)関連性と single hit dominance が TSR 評価の核心課題**: [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]] は、TSR ではクエリごとに複数の関連候補が存在する($|P(q)| > 1$)ことが典型的であり、この場合 Hit@K のような top-$K$ 指標は 1 件の高順位ヒットだけで見かけ上高スコアになる single hit dominance に陥ると指摘する。これは Etsy の Oculus が採用した形状記述アルファベット手法(2015 年当時、Elasticsearch のスロッピーフレーズクエリで単一の最類似系列を返す設計)が抱えていたのと同種の問題であり、単一最近傍の検索精度だけでは運用上十分な評価にならないことが、10 年越しに学術的な指標設計(AdaBase Ranking Scorecard)として定式化された形になる。
- **ラベル起因ノイズの明示的な除去が検索データセット構築の鍵**: TSRBench の UCR-R は、分類ラベルをそのまま検索の関連性として流用すると「形状は似ているが意味的に無関係」「ラベルは同じだが形状が大きく異なる」という 2 種のノイズが生じることを指摘し、2 段階の再構成(クラス内コア形態の抽出、混同しやすいクラスペアの除外)と 2 レビュアー品質管理で対処する。Etsy の類似度検索が形状記述アルファベット・DTW・SBD という手法選択の議論に留まっていたのに対し、TSRBench はデータセット構築そのものの方法論を体系化している点で一段階進んでいる。
- **本番テレメトリでのドメインシフトが埋め込みベース手法の優位性を覆すことがある**: [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]] の産業データセット CU-RCA(通信事業者のインシデント中心 KPI テレメトリ)では、単純な統計的距離(Pearson・Chebyshev)が事前学習済み埋め込み(基盤モデルエンコーダ含む)を上位ランクで上回るという結果が観測された。これは「埋め込みベースの深層学習手法は形状記述アルファベット等の古典手法を精度で上回るか」という本ページの既存の問い(下記)に対し、少なくとも産業運用テレメトリの文脈では「一般には言えない、ドメイン適応なしでは古典的統計距離が優位になりうる」という具体的な反証を与える。([[本番接地型ベンチマーク]] の「合成環境は探索空間の構造を歪める」という一般原則の、時系列検索領域における独立した再確認とも位置づけられる)
- [ストリーム] 全対比較の O(n²) を避ける近似の一系統として、ラグを等比探査し窓平均で平滑化して相互相関関数を O(log n) 空間で保つ BRAID がある。ラグを含む類似度を、系列長に依らない償却 O(1) で追跡できる。([[@2005__SIGMOD__BRAID - Stream Mining through Group Lag Correlations]])
## 未解決の問い
- 形状記述アルファベット(Etsy の [[Oculus]] が採用)の精度・再現率の定量評価は公開されていない。DTW や SBD(k-Shape で採用)と比較した場合のトレードオフはどうか。([[@2015__SREcon15 Europe__Signatures, Patterns, and Trends - Timeseries Data Mining at Etsy]])
- Elasticsearch のスロッピーフレーズクエリはトークン順序の一部を無視できるが、どの程度の形状変動まで許容できるか。許容範囲のパラメータ設定はどう決めるか。
- 時系列類似度検索の成功が根本原因特定([[Fault Localization]])にどの程度貢献するか。形状が似た時系列が同じ根本原因を持つ保証はないため、因果推論との組み合わせが必要か。
- TSRBench の CU-RCA で観測されたドメインシフト(統計的距離が事前学習埋め込みを上回る)は、通信事業者以外の運用ドメイン(クラウド・データベース・GPU クラスタ等)でも再現するか。ドメイン適応なしの基盤モデルエンコーダは、どのような条件下で古典的距離に劣後するかの一般法則は未解明。
- AdaBase Ranking Scorecard のスケールパラメータ $b(q)$ の決定関数(候補対ターゲット比の関数として設計)は、UCR-R・CU-RCA 以外のデータセットに移植した場合にも同様の識別力を保つか。
## 関連
- 手法: [[Oculus]](Etsy 製の時系列類似度検索 OSS)/ AdaBase Ranking Scorecard・UCR-R・CU-RCA(TSRBench)
- 接続概念: [[異常検知]](類似度検索は異常検知の後段として根本原因を絞る)/ [[時系列クラスタリング]](類似度計算を共有する)/ [[Fault Localization]](根本原因候補の絞り込みへの応用)/ [[本番接地型ベンチマーク]](CU-RCA は産業テレメトリに基づく本番接地型データセットの一例)
- エンティティ: [[Andrew Clegg]] / [[Etsy]] / [[Changhua Pei]] / [[Cenjie Hu]]
- ソース: [[@2005__SIGMOD__BRAID - Stream Mining through Group Lag Correlations]]
- 概念: [[ラグ相関]] / [[時系列次元削減]]
## 出典
- [[@2015__SREcon15 Europe__Signatures, Patterns, and Trends - Timeseries Data Mining at Etsy]]
- [[@2026__KDD__TSRBench : Benchmarking Time-Series Retrieval]](TSR のベンチマークスイート。UCR-R・CU-RCA データセット、AdaBase Ranking Scorecard、産業ドメインシフトの実証)