# Datadog
## 定義
Datadog はオブザーバビリティ / 監視の SaaS ベンダで、Logs(Log Management・Error Tracking)・Traces(APM)・Metrics・Alerts を統合する本番テレメトリプラットフォームを提供する。自社を「the largest dataset of production telemetry data in the industry」と位置づけ、その上に自律 SRE エージェント [[Bits AI SRE]] を構築している。([[@2026__Datadog__Building Bits AI SRE - Autonomous Incident Investigation Agent]])
## 役割・位置づけ
- [[Bits AI SRE]] を **Service Management** 製品カテゴリ(Incident Response・Workflow Automation と並ぶ)で提供する。
- [[Google]] に次ぐ本 wiki 2 例目の産業界一次情報の出所。Google が自社 SRE 運用のホワイトペーパーを出すのに対し、Datadog は監視ベンダとして**顧客のテレメトリを入力に取る**調査エージェントを製品化する立場。
- 強みは保有する本番テレメトリの規模——自社サービスの障害だけでなく多数の顧客環境の運用データにアクセスできる点。
- AI Research 部門が [[Carnegie Mellon University]] と共同で観測データ特化の[[時系列基盤モデル]] [[Toto]] とベンチマーク [[BOOM]] を開発・オープンソース化(Apache 2.0)。Toto/BOOM の観測データは顧客データを除く自社内部監視メトリクスのみを出所とし、本番(訓練)とステージング(評価)を分離して汚染を防ぐ。保有テレメトリの規模が事前学習コーパス(主要 TSFM の4〜10倍)の源泉となっている。
- 保有する本番テレメトリの規模を、予測タスク([[Toto]]/[[BOOM]])・インシデント対応の推論評価・**コード最適化**にも展開する。コード最適化では [[DODO]](Datadog Observability-Driven Optimizer、[[Junaid Ahmed]]・[[Piotr Bejda]] 開発)が CPU プロファイルと Live Debugger 実呼び出しを組み合わせた本番接地型ベンチマーク生成を実現し、成熟した Go サービスの CPU コストを 8% 以上削減した。([[@2026__Datadog__Production-Grounded Benchmarks for AI Code Optimization]])
- 保有する本番テレメトリの規模を、予測タスク([[Toto]]/[[BOOM]])だけでなく**インシデント対応の推論評価**にも展開する。[[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]] では、Datadog エンジニアの Slack インシデントタイムラインを専門家アノテーションの一次源として、内部テレメトリのみから時系列質問応答ベンチマーク [[ARFBench]] を構築し、ハイブリッド [[Toto-1.0-QA-Experimental]] を開発した。顧客データは使わず内部ユーザー/システムのクエリ文字列のみを利用する点は Toto/BOOM と一貫する。
- 「you build it, you run it」文化を採り、各エンジニアが自らのシステムのオンコールを持つ。Sev-1 以上のインシデントでは社内インシデントアプリが自動で major-incident-commander ローテーション(約30人)を呼び出し、担当チームは案件ごとに「ワークストリーム」として自己組織化する。2023年3月8日には、Ubuntu の自動セキュリティ更新が誘発した systemd/networkd の経路フラッシュにより AWS・GCP・Azure の複数リージョンで Kubernetes ノードが同時に接続不能になる大規模インシデントが発生し、500人超が対応、単一の Zoom 通話に14時間で493人が入退室する規模に至った。AWS では Auto Scaling Group のヘルスチェックによるノード入れ替えでステートフルワークロードのデータ損失・クォーラム喪失が発生し、GCP/Azure より復旧が長引いた。(Source: [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]])
## 関連
- エンティティ: [[Bits AI SRE]] / [[Toto]] / [[BOOM]] / [[ARFBench]] / [[Toto-1.0-QA-Experimental]] / [[DODO]] / [[Carnegie Mellon University]] / [[Google]](産業界の対比) / [[Laura de Vesine]] / [[Rob Thomas]] / [[Maciej Kowalewski]] / [[Jamie Luck]] / [[Laurent Bernaille]] / [[Kubernetes]]
- ソース: [[@2026__Datadog__Building Bits AI SRE - Autonomous Incident Investigation Agent]] / [[@2025__Datadog__Introducing Bits AI SRE]] / [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]] / [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Research]] / [[@2026__Datadog__Production-Grounded Benchmarks for AI Code Optimization]] / [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]] / [[@2025__SREcon25Americas__Incident Management Metrics that Matter]] / [[@2025__Datadog Engineering Blog__Failure is inevitable - Learning from a large outage and building for reliability in depth at Datadog]]
- 概念: [[根本原因分析]] / [[agentic SRE]] / [[AIOps]] / [[時系列基盤モデル]] / [[時系列質問応答]] / [[本番接地型ベンチマーク]] / [[エージェント型コーディング]] / [[ポストモーテム]] / [[インシデント管理]] / [[グレースフルデグレーデーション]]
- 関連 MOC: [[Telemetry - MOC]] / [[SRE - MOC]] / [[時系列基盤モデル - MOC]]
## 出典
- [[@2026__Datadog__Building Bits AI SRE - Autonomous Incident Investigation Agent]]
- [[@2025__Datadog__Introducing Bits AI SRE]](GA 発表・プレビュー機能、2025-06-10 公開)
- [[@2025__NeurIPS2025__This Time is Different - An Observability Perspective on Time Series Foundation Models]]
- [[@2026__arXiv__ARFBench - Benchmarking Time Series Question Answering Ability for Software Incident Response]]
- [[@2026__Datadog__Toto-2.0-Time-Series-Forecasting-Enters-the-Scaling-Era]](Toto 2.0、arXiv:2605.20119)
- [[@2026__Datadog__Production-Grounded Benchmarks for AI Code Optimization]](DODO、2026-06-08)
- [[@2023__SREcon23EMEA__The World Blew Up but We're All Okay - How We Managed a Massive-scale Incident at Datadog]](2023年3月8日の大規模マルチクラウドインシデント)
- [[@2024__SREcon24Americas__Storytelling as an Incident Management Skill]]([[Laura de Vesine]] によるインシデント管理技能としてのストーリーテリング論、自社のパイプライン遅延・キャッシュ層インシデントを匿名化した具体例として使用)
- [[@2025__SREcon25Americas__Incident Management Metrics that Matter]]([[Jamie Luck]]・[[Laura de Vesine]] による Datadog 実践に基づくインシデントメトリクスフレームワーク、SREcon25 Americas 2025-03-27)
- [[@2025__Datadog Engineering Blog__Failure is inevitable - Learning from a large outage and building for reliability in depth at Datadog]]([[Laura de Vesine]]・[[Rob Thomas]]・[[Maciej Kowalewski]] による 2023 年 3 月大規模障害後の[[グレースフルデグレーデーション]]設計転換の技術報告、2025-10-15)