# CloudDiag フロントエンドで性能異常が観測された際、運用者が手動でトリガーして根本原因分析を実行するシステム [56]。(Source: [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.1 Log-based and Distributed Tracing-based Root Cause Analysis Techniques]] §4.2.2) ## 動作 1. 収集済みトレースを処理し、「anomalous group」(同一のservice call treeを共有し、サービス間相互作用の応答時間の変動係数が所与の閾値を超えるトレース群)を特定する。 2. anomalous groupのトレースをカテゴリごとに行列として表現する。 3. Robust Principal Component Analysis(RPCA)を適用する。行列がgross sparse errorで汚染されている場合、RPCAはエラーが現れる列を抽出できる。この性質を利用して、応答時間が異常なサービスに対応する「エラー列」を特定する。 4. これらのサービスが観測された異常の根本原因候補として返される。根本原因サービスは、異常カテゴリで異常として現れた回数に基づいてランク付けされる(出現回数が多いほど、そのサービスが原因である可能性が高いとみなす)。 TraceAnomaly [45] と同じくdirect analysisに分類され、フロントエンドの性能異常を引き起こしたサービス間相互作用の応答時間を直接解析する点で共通する。CloudDiagはRPCAベースの手法を、TraceAnomalyは深層ベイジアンニューラルネットワークによる異常検知結果からの応答時間相関を、それぞれ用いる点で異なる。 ## 関連 - ソース: [[@2021__CSUR__Anomaly Detection and Failure Root Cause Analysis in (Micro)Service-Based Cloud Applications - A Survey - Chapter 4.1 Log-based and Distributed Tracing-based Root Cause Analysis Techniques]] - 概念: [[分散トレーシング]]