## 定義 クラウドインシデントは、期待されるサービス運用を損なう本番時の障害事象であり、停止、性能劣化、利用者影響を含む。(Source: [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]]) ## 横断的知見 - 冗長化は必要条件にすぎず、検知、フェイルオーバー、バックアップの復旧連鎖と、本番条件で露出するソフトウェアバグの双方を検証する必要がある。(Source: [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]], [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]]) - **CSI 障害はクラウドインシデントの20%を占める**: GCP・Azure・AWS の本番インシデント55件のうち11件が[[クロスシステムインタラクション障害]]に起因する。インシデント継続時間の中央値は106分で、8/11件が YouTube・Gmail など外部サービスに波及した。クラウドベンダーは通常最も深刻なインシデントのみ公開するため、この20%という数字は CSI 障害の壊滅的な影響力を示す。(Source: [[@2023__EuroSys__Fail through the Cracks - Cross-System Interaction Failures in Modern Cloud Systems]]) ## 未解決の問い - 公開ポストモーテムと内部インシデント記録の分類をどう接続し、一般化可能な予防策に変換するか。 - クラウドインシデントの根本原因として [[クロスシステムインタラクション障害]] が20%を占めるとすると、現在の AIOps/障害診断ツールはこのモードに対応できているか? ## 関連 - [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]] - [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]] ## 出典 - [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]] - [[@2019__HotOS__What Bugs Cause Production Cloud Incidents]]