# Scaling Telemetry Workloads in Cloud Applications ## 概要 クラウドアプリケーションの信頼性維持に不可欠な[[テレメトリ]]システムを、計装(instrumentation)・ストレージ(storage)・マイニング(mining)の 3 層に分解し、各層のワークロードを「スケーラビリティと運用複雑性の低減の両立」という一貫した観点でスケールさせる手法を提案した博士論文である。既発表 3 編(第 3・4・5 章)を単一の枠組みに統合し、最終章で「データ削減は文脈知識が最も豊富な両端(計装層・マイニング層)で行い、保持層は文脈非依存の堅牢な保持に徹するべき」という設計指針を導いた点が、個別論文には無い本論文固有の貢献である。 > [!abstract] 概要(英文 abstract の日本語訳) > クラウドコンピューティングはオンラインサービスの提供を変え、アプリケーションをますます分散的かつ複雑にした。システムの信頼性の維持のため、運用者はテレメトリデータ——計装を通じて収集されるシステム挙動・性能・利用率・イベントの体系的な測定——に依存し、障害管理・性能最適化・キャパシティ計画・セキュリティ監査といった本質的な機能を支える。これらのテレメトリデータは本質的に多様で、構造化・半構造化・非構造化の形式で存在し、時間的・空間的・数値的・テキスト的な情報を含み、時系列変動や処理経路の内訳を捉える。その処理は 3 つの主要な層からなる: 計装によるデータ収集、ストレージによるデータ保持、マイニングによるデータ分析。アプリケーションがスケールすると、これら全層にわたるテレメトリデータ処理の要求は大きく増大する。 > テレメトリシステムのスケーリングには相当な課題が伴う。データ量の急増は一連の問題を引き起こす: 計装はアプリケーションに追加のリソースオーバーヘッドを課し、ストレージシステムはデータ取り込みと保持の増大する要求を捌かねばならず、機械学習ベースの分析の有効性はデータセットの増大とともに低下しがちである。これらの課題は、アプリケーションとそのテレメトリシステムの双方を監督せねばならないシステム管理者の運用負担を軽減する必要性によってさらに激化する。従来手法は典型的に広範な手作業の介入・専門知識・複雑なカスタムインフラを要し、大規模な展開を困難にする。ここから鍵となる研究課題が導かれる——テレメトリシステムの 3 つの重要な層(計装・ストレージ・マイニング)にわたり、運用オーバーヘッドを最小化しつつテレメトリワークロードを効率的にスケールできるか? > 本学位論文はテレメトリワークロードのスケーリングにおける 3 つの具体的な課題に焦点を当てる。第 1 の課題は、継続的なネットワークトポロジ発見のための詳細な空間的テレメトリデータの計装に伴うリソースオーバーヘッドであり、対象アプリケーションシステムに無視できないリソースオーバーヘッドを課す。第 2 の課題は膨大な時系列データのストレージに関するもので、特にデータ保持が 1 年を超えると計算資源を圧迫しストレージコストを押し上げる。第 3 の課題はデータマイニングの複雑性であり、時系列データ量の増大に伴い障害の根本原因特定が次第に困難で時間を要するものになる。 > これらに対処するため、テレメトリ処理の各層に整合し実務的な運用要件を重視した 3 つの的を絞ったアプローチを提案する。計装の層では、アプリケーションに透過的に動作するネットワークコール発見手法を導入する。OS カーネル内で関連するネットワークフローを束ねることで、アプリケーションコードの変更を要さず計算オーバーヘッドを大幅に削減し、高負荷なネットワーク下でも最小の CPU 使用を維持する。ストレージの層では、高スループットなデータ取り込みとコスト効率の高い長期保持という相反する要求を調停する階層的な時系列データ集約型アーキテクチャを提案する。これはメモリベースとディスクベースのデータベースシステムを自動的なデータ階層化で統合し、運用を簡素化しつつ高い取り込み率を達成する。広く使われるデータベースシステムをカスタム実装でなく活用するため、クラウド環境での展開に適する。マイニングの層では、大量の時系列データを削減して自動的な障害箇所特定を強化する特徴量削減フレームワークを開発する。教師なし学習を用い、システム挙動の障害関連パターンを特定し、手作業の訓練データ準備を不要にしつつ最小のパラメータ調整で堅牢な性能を保つ。 > 実機とベンチマークツール上での実験的評価により、提案手法群が既存手法に対して大幅な性能改善をもたらし、instrumentation・storage・mining の各層で運用を簡素化することを示す。これらの貢献は、現代クラウドアプリケーションの信頼性要件を満たすスケーラブルで保守可能なテレメトリシステムを構築するための基盤を築く。 ## 書誌情報 - 著者: [[Yuuki Tsubouchi]](坪内佑樹) - 学位: 博士(情報学)、[[Kyoto University]] 大学院情報学研究科、2025 年 3 月 - 指導教員: Yasuo Okabe(岡部寿男)教授。審査委員: Takeshi Iwashita、Kazuyuki Shudo - URL: https://repository.kulib.kyoto-u.ac.jp/records/5bc4eae3-e02a-42d1-ab2d-16b13868b3a6 - 原本: `.raw/theses/phd-tsubouchi-2025-telemetry/`(PDF 122 ページ) - 構成: 全 6 章(導入 2 章 + 貢献 3 章 + 結論 1 章) ## 構成と主要テーマ ### 導入と背景(第 1〜2 章) 論文全体の枠組みと、以降の章が前提とする用語体系を定める。 → [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 1 Introduction]] — クラウドアプリケーションの信頼性課題を起点に、テレメトリの計装・保持・分析の 3 層モデルとその運用複雑性を提示し、RQ1〜RQ3 と第 3〜5 章の貢献・論文構成を概観する導入章。 → [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 2 Background]] — クラウドアプリケーションのアーキテクチャ・信頼性用語(fault / error / failure / incident)・テレメトリの分類(time-oriented / path-oriented)と 3 層システムモデル・各層のワークロード特性を定義する背景章。 ### 3 つの貢献(第 3〜5 章) テレメトリ処理の各層に 1 章ずつ対応し、いずれも既発表論文を基礎とする。 → [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 3 Efficient TCP-UDP Socket-based Instrumentation in Kernel for Continuous Construction of Network Call Graphs]] — **計装層**。カーネル内フロー束ね(in-kernel flow bundling)により、TCP/UDP ソケット計装で CPU オーバーヘッド 2.2% 未満・レイテンシ最大 6µs を維持しながらネットワークコールグラフを非侵入かつ継続的に構築する。 → [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 4 Time Series Data-Intensive Application by Automated Data Tiering in Heterogeneous Key-Value Stores]] — **ストレージ層**。[[HeteroTSDB]] はメモリベース KVS とディスクベース KVS を TTL + jitter で連合させる TSDA アーキテクチャで、[[KairosDB]] 比 3.98 倍の取り込みスループットを達成し、2017 年 8 月に [[Mackerel]] へ本番投入された。 → [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 5 Feature Reduction of Multivariate Time Series Data for Automated Fault Localization]] — **マイニング層**。障害起因の変化点が時間的に密集する性質を使い、多変量メトリクスから障害時間窓を教師なしで局所化する特徴量削減フレームワーク [[MetricSifter]] を提案し、シミュレーションと実データの双方で精度・時間効率がベースラインを上回ることを示す。 ### 結論(第 6 章) → [[@2025__PhD__Scaling Telemetry Workloads in Cloud Applications - Chapter 6 Conclusion]] — データ削減は文脈知識が最も豊富な計装層・マイニング層の両端で行い、保持層は文脈非依存の堅牢な保持に徹すべきという設計指針(§6.2)と、collect-first から use-first への転換・LLM 障害管理向け failure snapshot・LLM 訓練基盤のテレメトリという 3 つの将来方向(§6.3)を提示する。 ## 元になった出版論文 List of Publications(印字 p.iv)より。 | 章 | 出版論文 | wiki | |---|---|---| | Ch.3 | Tsubouchi, Furukawa, Matsumoto, "Low Overhead TCP/UDP Socket-based Tracing for Discovering Network Services Dependencies", JIP Vol.30, pp.260-268, March 2022 | [[@2022__IPSJ JIP__Low Overhead TCP-UDP Socket-based Tracing for Discovering Network Services Dependencies]] | | Ch.4 | 坪内佑樹ほか「HeteroTSDB: A High Performance Time Series Database for Automated Data Tiering in Heterogeneous Distributed KVSs」情報処理学会論文誌 Vol.62 No.3, pp.818-828, 2021 年 3 月(和文) | (未取り込み) | | Ch.5 | Tsubouchi, Tsuruta, "MetricSifter: Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications", IEEE Access Vol.12, pp.37398-37417, March 2024 | [[@2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications]] | 取り込み時に第 3 章・第 5 章と論文版を突き合わせた結果、CPU オーバーヘッドの数値・実験環境(Ch.3)、BA 0.981・実行時間削減幅・ハイパーパラメータ・データセット構成(Ch.5)のいずれも一致し、**数値・主張の食い違いは検出されなかった**。thesis 版は Ch.3 でネットワークサービス数 10,000 規模の挙動とレイテンシオーバーヘッドの手法別内訳を論文版より詳細に記述するが、これは拡張であり矛盾ではない。 ## 位置づけと影響 - **3 層を貫く単一の枠組み**。個々の貢献は既発表だが、テレメトリ処理を計装・ストレージ・マイニングの 3 層に分解し、各層のワークロードを同一の評価軸(スケーラビリティ × 運用複雑性)で扱う枠組みは本論文で初めて統合された([[Scaling Telemetry Workloads]])。 - **標準技術ベースで運用複雑性を下げる設計思想**。eBPF・Redis・Cassandra・教師なし学習という広く使われる技術を土台にし、カスタム実装を避けることで運用負担を抑える方針が全章に一貫する。 - **本番運用への適用実績**。HeteroTSDB は [[Hatena]] の SaaS 監視サービス [[Mackerel]] に実投入され、本番構成の差異と 1 年間のインシデント 2 件が第 4 章 §4.6 Lessons Learned に記録されている。研究成果と本番運用の差分が論文に残っている点は稀である。 - **限界**。各層の貢献は既発表内容のため層ごとの新規性は限定的であり、HeteroTSDB のクエリ性能評価は今後の課題として残る。フロー束ねの利点はネットワークサービス数が極端に大きい領域で消失する。 ## 関連 - 概念: [[Scaling Telemetry Workloads]] / [[テレメトリ]] / [[分散トレーシング]] / [[時系列データベース]] / [[特徴量削減]] / [[Fault Localization]] / [[変化点検知]] / [[eBPF]] / [[ネットワーク依存性発見]] / [[メトリクス削減]] - 実体: [[Yuuki Tsubouchi]] / [[Kyoto University]] / [[HeteroTSDB]] / [[MetricSifter]] / [[go-conntracer-bpf]] / [[Meltria]] / [[Mackerel]] / [[Hatena]] - 関連ソース: [[@2022__IPSJ JIP__Low Overhead TCP-UDP Socket-based Tracing for Discovering Network Services Dependencies]] / [[@2024__IEEE Access__MetricSifter - Feature Reduction of Multivariate Time Series Data for Efficient Fault Localization in Cloud Applications]] ## 出典 - Yuuki Tsubouchi, *Scaling Telemetry Workloads in Cloud Applications: Techniques for Instrumentation, Storage, and Mining*, PhD dissertation, Graduate School of Informatics, Kyoto University, March 2025. - 原本: `.raw/theses/phd-tsubouchi-2025-telemetry/phd-tsubouchi-2025-telemetry.pdf`