# Microsoft Azure
[[Microsoft]] のパブリッククラウドプラットフォーム。[[Zodiac]]([[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]], SOSP '24)が[[Terraform]] 経由でセマンティックチェックを検証した対象クラウドで、leading な IaC フレームワークと leading なクラウドベンダの組み合わせとして選ばれた。([[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]])
- **対象範囲**: 人気の 52 リソース種別。Zodiac はここから 510 の検証済みチェックを発掘した。
- **provider 固有のセマンティクス例**: VM とその NIC は同一リージョンでなければならない、サブネット CIDR は重複不可、"GWSubnet"/"FWSubnet" のような予約サブネット名、Premium ストレージアカウントは GZRS 冗長を使えない(レイテンシ最適化のため)、APPGW に使う IP は Standard sku 必須、など——いずれも Terraform のコンパイルを通過するがデプロイ時に違反が顕在化する。
- これらの規約は公式ドキュメントにも誤りがあり、Zodiac は Terraform Azure provider の公式使用例の 4 件のバグを発見・修正させた。
- **クラウド管理エージェントのテストベッド**: [[@2025__OSR__Cloud Infrastructure Management in the Age of AI Agents]] は 4 モダリティ([[クラウド管理モダリティ|SDK・CLI・IaC・ClickOps]])のエージェントを Azure VM 管理で比較した。SDK は Azure Python SDK、CLI は Azure "cloud shell"、IaC は [[Terraform]]、ClickOps は Azure コンソール([[WorkArena]] ベース)を操作。SDK/CLI/IaC のモデルは [[Azure Copilot]](GPT-4 ベースの Azure 特化)。Azure 固有の制約として「standard→spot 変更は破棄・再作成が必要」「Azure Service Health の region 障害情報は Web ポータルでしか取れない」が挙がる。(Source: [[@2025__OSR__Cloud Infrastructure Management in the Age of AI Agents]])
- **インシデント管理研究の本番データソース**: [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]] では Azure Redmond の運用エンジニア 3 名([[Feng Gao]]・[[Zhangwei Xu]]・[[Yingnong Dang]])が Microsoft Research と共同で 18 オンラインサービス(Azure および Office 365 等)の本番インシデントを分析し、[[DeepIP]] の評価データを提供した。Microsoft の AIOps 研究は Azure 本番運用エンジニアと Research 研究員の共著という構造で長期継続している。
- **AI ワークロード本番データソース**: [[@2026__FSE__TSGuard - Automated User-Centric Incident Diagnosis for AI Workloads in the Cloud]] は Azure の本番 GPU クラスタから 2023-04〜2024-03 の 1 年分インシデントを採取し([[TSGuard]] の評価データ 778 件、テスト 208 件)、GPU 関連が 52.47%・System Software 27.79%・Interconnect & Networking 8.18%・User 8.83%・Framework 1.17% という分布を示した。GPU 系の recurrence rate は 8.78 で従来クラウドワークロードの code/dependency 主体構造([19] の ~40%/16.4%)と明確に異なる。標準 IB ツール `ibv_devinfo` がコンテナ内部で利用不可、`NCCL_IB_HCA` の Ethernet 取り違えなど、Azure の VM 構成固有の制約が LLM のドメイン知識欠如(Ch3)を顕在化させる例として扱われる。
- **本番インシデントトリアージの分散型エージェント化**: [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]] は Azure 内の 15 チーム・数百万ホストに [[Comfey]] を 22 か月間デプロイし、約 19,500 件のインシデントを 91.5% の精度でトリアージした。Azure インシデント管理システムの実証分析(2024 年 3 月〜2026 年 1 月、15 チーム分)から、インシデントの多くが 5〜30 チームにまたがること・85% が重複/準重複レポートを持つこと・月間 12.1% でトリアージ判断が覆ることを明らかにし、これらの知見がチームスコープドかつ分散型のトリアージ設計を動機づけた。先行の Azure 本番トリアージシステム [[COMET]] と比較してトリアージ精度 +7.55%・トリアージ時間 4.38 倍・緩和時間 2.91 倍の改善を報告する。(Source: [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]])
## 関連
- ソース: [[@2024__SOSP__Unearthing Semantic Checks for Cloud Infrastructure-as-Code Programs]] / [[@2025__OSR__Cloud Infrastructure Management in the Age of AI Agents]] / [[@2020__ASE__How Incidental are the Incidents - Characterizing and Prioritizing Incidents for Large-Scale Online Service Systems]] / [[@2026__FSE__TSGuard - Automated User-Centric Incident Diagnosis for AI Workloads in the Cloud]] / [[@2026__SREcon26Americas__Reliability Equilibrium - The Hidden Playbook behind SRE Influence]] / [[@2026__FSE Companion__An Agentic Framework for Triaging Incidents in Production Cloud Infrastructure]]
- 在籍者: [[Daria Barteneva]](Principal SRE / Observability Engineering)
- 運営: [[Microsoft]]
- 関連概念: [[Infrastructure as Code]] / [[設定マイニング]] / [[クラウド管理モダリティ]]
- 関連プロダクト: [[Zodiac]] / [[Terraform]] / [[Azure Copilot]] / [[WorkArena]]
- 関連 MOC: [[Network - MOC]] / [[Software Engineering - MOC]]