# Slack Technologies ## 概要 Slack Technologies はクラウドベースのビジネスコミュニケーションプラットフォームを開発・運営する企業(現 Salesforce 傘下)。数百万人のユーザーが利用する SaaS として、高度な信頼性要件のもと大規模なオブザーバビリティインフラを運用してきた。 本 wiki では 2020 年 5 月 12 日の完全サービス停止インシデント(48 分間のアウテージ)を経験から、MELT(Metrics/Events/Logs/Traces)データ管理の産業事例研究の主題として登場する([[@2021__SIGMOD Record__Towards Observability Data Management at Scale]])。 2018年9月には自己誘発型の障害が連続する「reliability crisis」に見舞われ、これを契機にリリースツール刷新(Deploy Commander 制・段階的カナリアロールアウト)・Service Ownership 移行・Incident Management プログラム構築の3本柱の改革を行った([[Brent Chapman]]、[[@2021__SREcon21__Evolution of Incident Management at Slack]])。 同じ2020年5月12日のアウテージは、[[Suman Karumuri]] が共著者に加わったメトリクスストレージエンジン論文 [[@2022__CIDR__Mach - A Pluggable Metrics Storage Engine for the Age of Observability]] の冒頭でも、オブザーバビリティの重要性を示す事例として言及されている。同論文は Slack が1日あたり40億のユニークソースから毎秒1200万サンプルを収集し、最大12TBの圧縮データを生成するという規模感を、大容量メトリクスストレージの動機として引用する。 ## 代表的な規模感(2020 年時点) - Metrics: 4B 時系列/日、12M samples/秒、12TB/日(圧縮)、30 日保持 - Events: 250TB/日(生)、70PB 超を蓄積、3〜24 ヶ月保持 - Logs: 90TB/日(生)、7 日保持 - Traces: 2TB/日(生)、14 日保持 - Prometheus プール約 100 運用、20 超のソフトウェアコンポーネント ## 関連 - 関係者: [[Suman Karumuri]] - [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]] ## 出典 - [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]](§3 Observability at Slack)