# Slack Technologies
## 概要
Slack Technologies はクラウドベースのビジネスコミュニケーションプラットフォームを開発・運営する企業(現 Salesforce 傘下)。数百万人のユーザーが利用する SaaS として、高度な信頼性要件のもと大規模なオブザーバビリティインフラを運用してきた。
本 wiki では 2020 年 5 月 12 日の完全サービス停止インシデント(48 分間のアウテージ)を経験から、MELT(Metrics/Events/Logs/Traces)データ管理の産業事例研究の主題として登場する([[@2021__SIGMOD Record__Towards Observability Data Management at Scale]])。
2018年9月には自己誘発型の障害が連続する「reliability crisis」に見舞われ、これを契機にリリースツール刷新(Deploy Commander 制・段階的カナリアロールアウト)・Service Ownership 移行・Incident Management プログラム構築の3本柱の改革を行った([[Brent Chapman]]、[[@2021__SREcon21__Evolution of Incident Management at Slack]])。
同じ2020年5月12日のアウテージは、[[Suman Karumuri]] が共著者に加わったメトリクスストレージエンジン論文 [[@2022__CIDR__Mach - A Pluggable Metrics Storage Engine for the Age of Observability]] の冒頭でも、オブザーバビリティの重要性を示す事例として言及されている。同論文は Slack が1日あたり40億のユニークソースから毎秒1200万サンプルを収集し、最大12TBの圧縮データを生成するという規模感を、大容量メトリクスストレージの動機として引用する。
## 代表的な規模感(2020 年時点)
- Metrics: 4B 時系列/日、12M samples/秒、12TB/日(圧縮)、30 日保持
- Events: 250TB/日(生)、70PB 超を蓄積、3〜24 ヶ月保持
- Logs: 90TB/日(生)、7 日保持
- Traces: 2TB/日(生)、14 日保持
- Prometheus プール約 100 運用、20 超のソフトウェアコンポーネント
## 関連
- 関係者: [[Suman Karumuri]]
- [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]]
## 出典
- [[@2021__SIGMOD Record__Towards Observability Data Management at Scale]](§3 Observability at Slack)