# Enhanced Monitoring-as-a-Service for Effective Cloud Management > [!abstract] 概要 > 本論文は、モニタリングアズアサービス(MaaS)の概念、その主要な構成要素、およびクラウドにおける MaaS の主要な機能要件を提示する。MaaS は、瞬時的な違反検知、周期的な状態監視、単一テナント監視といった従来の状態監視機能だけでなく、監視コスト、スケーラビリティ、監視サービスの統合と分離の有効性を最適化する性能強化機能もサポートすべきだと主張する。本論文では 3 つの強化された MaaS 機能を示し、ウィンドウ型状態監視がノイズや外れ値に対して頑健であるだけでなく、通信コストを大きく節約することを示す。同様に、違反尤度に基づく状態監視は、重要なイベントを検知できる尤度に応じて監視強度を動的に調整でき、監視サービスの統合において大きな利得をもたらす。最後に、状態監視におけるマルチテナンシーのサポートにより、複数のクラウドユーザが、より手頃なコストで、性能と効率を高めた MaaS を利用できる。実世界のシステムトレースおよびネットワークトレースを用い、エミュレートしたクラウド環境で広範な実験を行った。実験結果は、提案する MaaS フレームワークが、監視コストの大幅な低減、高いスケーラビリティ、優れたマルチテナンシー性能を達成することを示唆している。 ## 論文情報 - 著者: [[Shicong Meng]]・[[Ling Liu]](いずれも [[Georgia Institute of Technology]]) - 掲載: IEEE Transactions on Computers(2013 年) - 原本: [[.raw/papers/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management.pdf]] ## 概要 クラウド管理に不可欠な状態監視(state monitoring)をサービスとして提供する MaaS について、機能要件と、コーディネータ方式の実装枠組みを示す。基本機能に加える 3 つの拡張として、ウィンドウ型違反検知、違反尤度に基づくサンプリング、マルチテナント向けの監視トポロジ計画を提案する。通信コスト 50〜90% 削減、サンプリングコスト 10〜90% 削減を報告する。 ## 問題設定 状態監視とは、分散アプリケーションの一側面(例: 全体のタイムアウト要求数)が正常状態から逸脱していないかを継続的に評価することである。分散レートリミットを例に、次の 3 層で課題を整理する。 - 大域違反検知: 各ノードのローカル値を集めて集約値がしきい値を超えたかを判定する。瞬時モデルは急増・ノイズ・外れ値で不要な違反を出し、通信コストも大きい。1k 超のフローを 500 サーバで監視すると監視だけで 230MB/s に達しうる。 - ローカル状態監視: 周期サンプリングはコストと精度が硬直的なトレードオフにあり、安定した状態でも無駄が出る。 - マルチテナンシー: 監視タスクはサーバや指標が重なる。静的な木やタスクごとの木は、メッセージ単位のオーバーヘッドと負荷偏りに対応できない。 要件は、通信オーバーヘッドの最小化、ノイズの最小化、監視の有効性の最大化の 3 点である。 ## 提案手法 ### ウィンドウ型違反検知 閾値 T を超える状態が L 時間単位連続したときだけ警報を出す。 - モニタ側は局所しきい値 T_i(合計が T 以下)とフィルタリングウィンドウ p_i を持つ。違反を 1 度報告したら p_i 単位時間は報告を抑制する。 - コーディネータ側は、報告済みの重なるフィルタリングウィンドウを連結して懐疑ウィンドウ(skeptical window)を維持する。これは連続大域違反の最悪ケースの長さを表す。懐疑ウィンドウが L に達したときだけ大域ポーリングを行う。 - 見逃し(偽陰性)は最悪ケースの見積もりゆえ生じず、完全な局所違反情報を確認してから警報するため偽陽性も生じない。 - T_i と p_i は通信コストモデルに基づく EM 型の局所探索(山登り)で調整する。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig01-communication-cost-example.png]] (Figure 1. Implications on Communication Cost) Figure 1『Implications on Communication Cost』の例では、瞬時検知が 22 メッセージ、集中型ウィンドウ検知も 22、分散ウィンドウ検知は 10、さらにフィルタリングウィンドウを加えると 3 メッセージ(86.36% 削減)になる。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig02-filtering-skeptical-windows.png]] (Figure 2. Filtering Windows and Skeptical Windows) ### 違反尤度に基づくサンプリング 違反尤度(VL)を P[v(t) > T] と定義する。次回サンプリングまでの間の見逃し率 β(I) をチェビシェフの不等式で上から抑え、ユーザ指定の許容誤差 err を超えない範囲でサンプリング間隔を伸ばす。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig03-violation-likelihood-sampling.png]] (Figure 3. Violation Likelihood Based Sampling) - 直近値としきい値の距離、および値の変化量 δ(平均・分散をオンライン更新)から尤度を見積もる。 - β̄(I) ≤ (1−γ)·err が p 回連続で成り立てば間隔を 1 伸ばし、β̄(I) > err なら即座に既定間隔へ戻す(γ=0.2, p=20)。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig04-violation-likelihood-adaptation.png]] (Figure 4. Violation Likelihood Based Adaptation) - 複数モニタでは、タスク全体の見逃し率が各モニタの見逃し率の和で抑えられることを利用する。許容誤差を均等に割り振った後、コスト削減の見込み(r_i/e_i)が大きいモニタへ反復的に配分を移す。 ### マルチテナント向けトポロジ計画 メッセージ当たり処理オーバーヘッドが大きい(Figure 5『CPU Usage vs Increasing Msg Num/Size』では受信ノード数 16 から 256 で CPU 使用率が約 6% から約 68%)ため、更新をまとめる設計が要る。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig05-cpu-vs-message.png]] (Figure 5. CPU Usage vs Increasing Msg Num/Size) スター型、単一木、タスクごとの木にはそれぞれ欠点がある(Figure 6『Motivating examples of topology planning』)。そこで、タスクごとの木を初期解として、木の統合・分割を局所探索する。第 1 目標は収容タスク数の最大化、第 2 目標はデータ配送コスト(メッセージオーバーヘッドと中継コスト)の最小化である。木の構築はスター状の木を作り、過負荷ノードがあれば木を「引き伸ばす」調整手続きで補う。最適トポロジの探索は NP 完全である。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig06-topology-planning.png]] (Figure 6. Motivating examples of topology planning) ## 新規性 - MaaS の機能要件と、基本機能に対する拡張機能の対応づけ(著者らは体系的な最初の取り組みと主張する)。 - 通信コスト、サンプリングコスト、監視資源の 3 段で、階層的に組み合わせられる技術を提示した点。 - ローカル状態監視のコストを無視してきた従来研究に対し、精度制御つきの動的サンプリングを提案した点。 ## 実験設定 - Java 1.6 のプロトタイプ(モニタサーバ、コーディネータサーバ、管理センタ)を Emulab に配備する。低性能機 30 台でデーモンを走らせクラウドを模擬し、監視系は 11 台で動かす。 - トレース: WorldCup 1998 の HTTP アクセスログ、[[PlanetLab]] 300 ノードの性能トレース(66 属性)、Internet2 の netflow トレース(約 4200 万フロー)、および合成トレース(一様分布・Zipf 分布)。 - 比較対象は、瞬時検知、Double Report、WIN-Naive(ウィンドウ型でパラメータ未調整)、PER-TASK(タスクごとの木)、ONE-TREE(単一木)、許容誤差の均等配分(even)である。 ## 実験結果 - 通信効率: WIN-Tune は瞬時検知よりメッセージ数が約 1 桁少なく、L を大きくするほど通信が減る(Figure 7『Comparison of Communication Efficiency in Terms of Message Number』)。内訳は、T や L の増加に伴い大域ポーリングの比率が増える(Figure 8『Communication Cost Breakup』)。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig07-communication-efficiency.png]] (Figure 7. Comparison of Communication Efficiency in Terms of Message Number) ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig08-cost-breakup.png]] (Figure 8. Communication Cost Breakup) - VL サンプリング: 周期サンプリングに対しサンプリング操作を 10〜90% 削減する。許容誤差が大きいほど、警報の選択率 k が小さいほど削減が大きい。ネットワーク・アプリケーション層のトレースでは、システム層より削減率が高い。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig09-overhead-saving.png]] (Figure 9. Monitoring Overhead Saving under Different Error Allowance and State Alert Rates) - 精度: 実際の見逃し率は多くの場合、指定した許容誤差以下である。選択率が高いタスクでは相対的に見逃し率が大きい。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig10-actual-misdetection.png]] (Figure 10. The Actual Mis-Detection) - 許容誤差の配分: 局所違反率の偏り(Zipf の歪度)が増すと均等配分のコスト削減は劣化し、適応配分は優位を保つ。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig11-sampling-coordination.png]] (Figure 11. Distributed Sampling Coordination) - トポロジ: 小規模タスクが増えると RPLAN は PER-TASK・ONE-TREE を上回る。大規模タスクが増えると RPLAN は PER-TASK に収束する。受信値の平均誤差は PER-TASK・ONE-TREE より 30〜50% 小さい。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig12-tree-partitioning.png]] (Figure 12. Tree Partitioning under Diff. Workload) ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig13-percentage-error.png]] (Figure 13. Comparison on Average Percentage Error) - 統合評価(分散レートリミット): ウィンドウ型監視で通信量を 65〜87% 削減し、VL サンプリングでサンプリングを約 60% 削減した。ノード当たり帯域超過は RPLAN で低く抑えられる。 ![[_attachments/2013__TC__Enhanced-Monitoring-as-a-Service-for-Effective-Cloud-Management/fig14-combined-performance.png]] (Figure 14. Combined Monitoring Performance) ## 考察 - 木の計画は資源消費の上界で見積もるため、木が高くなりがちで、観測遅延(Time-To-Observe)に敏感な用途では平均見積もりへ切り替える余地があると述べる。 - 1k 超のノードには多段の木で対応でき、ハートビートによるノード障害検知やコーディネータの主従構成も可能だとする。詳細は別論文に委ねている。 - VL サンプリングは、見逃しを一定程度許容できるタスクを前提とし、厳格な精度要求には向かない。 - ロバスト性、耐障害性、セキュリティ、プライバシー、弾力性は今後の課題である。 ## 強み / 弱点・課題 - 強み: 3 層(大域検知・ローカルサンプリング・トポロジ)の技術が独立に組み合わさり、実トレースと合成トレースの双方で通信・サンプリング・負荷の 3 面で効果を示す。 - 弱点・課題: 評価はエミュレーション環境(古い低性能機)であり、実クラウドの本番運用での検証ではない。VL は δ の時間独立性を仮定する。MaaS の課金・API・QoS といった「サービス」側の議論は本論文の範囲外である。詳細な証明とパラメータ調整は先行論文([16][17][22])に依存する。 ## 関連 - 概念: [[クラウドモニタリング]] / [[分散モニタリング]] / [[サンプリング手法]] - エンティティ: [[Shicong Meng]] / [[Ling Liu]] / [[Georgia Institute of Technology]] / [[PlanetLab]]