## 定義
データセンターネットワーク信頼性は、機器・光回線・経路・制御機構の障害下でも、サービスに必要なネットワーク可用性と品質を維持する性質である。(Source: [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]])
## 横断的知見
- ネットワークは公開停止事例で主要原因となる一方、実運用では多くの部品障害が冗長性で隠蔽される。したがって評価単位は部品故障数ではなくサービス影響を持つ事象である。(Source: [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]], [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]])
- PortLand(SIGCOMM 2009)は L2 ファブリックにおける障害検知・経路回復の効率化手法を示した。LDP の LDM(10ms 間隔・50ms タイムアウト)が専用ハートビートを兼ねることで、リンク障害検知とトポロジ監視を単一プロトコルに統合している。ファブリックマネージャへの通知は O(n) メッセージ(従来の全スイッチへのブロードキャスト型 O(n²) と対照的)に抑えられ、単一リンク障害の収束は実測約 65ms。これは TCP RTOmin(200ms)以内であり、既存 TCP セッションを保持したまま復旧できる。マルチキャストは集合被覆アルゴリズムにより単一スパニングツリーの制限なしに耐障害性を確保する。(Source: [[@2009__SIGCOMM__PortLand - A Scalable Fault-Tolerant Layer 2 Data Center Network Fabric]])
- **専用の再構成可能ハードウェア(OCS)による信頼性確保は、パケットスイッチの制御プレーン再構成(PortLand)とは異なる層で信頼性を作る**: PortLand はソフトウェア制御プレーン(ファブリックマネージャ・LDM ハートビート)による高速経路回復で信頼性を実現するのに対し、[[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]] は物理層のクロスコネクトそのものを[[光回線交換]](OCS、MEMS ミラー)で動的に再構成し、故障リンク・故障キューブを迂回する。TPUv4 は日次故障率 TPU マシン 0.08%・ICI ケーブル 0.005%・OCS 0.04% という部品単位の内訳を開示した上で、システム可用性 99.98% を達成する。これは「ソフトウェア制御プレーンの高速収束」(PortLand)と「ハードウェアレベルの物理再構成」(TPUv4/OCS)という、データセンターネットワーク信頼性を実現する2つの異なるアーキテクチャ的アプローチを提供する初の並置である。(Source: [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]], [[@2009__SIGCOMM__PortLand - A Scalable Fault-Tolerant Layer 2 Data Center Network Fabric]])
## 未解決の問い
- ネットワーク設計変更による障害率・復旧時間の変化を、アプリケーションの可用性 SLO にどう翻訳するか。
- PortLand の O(n) 収束モデルはファブリックマネージャが単一論理コントローラであることを前提とする。ファブリックマネージャ自体が障害した場合の収束時間への影響はどの程度か。
- TPUv4 の OCS ベース再構成([[光回線交換]])と PortLand のソフトウェア制御プレーン再構成は、復旧時間・ブラスト半径・実装コストのどの軸で優劣が入れ替わるか。両者を組み合わせた設計(物理層の OCS 再構成 + L2 制御プレーンの高速収束)は可能か。
## 関連
- [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]]
- [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]]
- 概念: [[光回線交換]]
## 出典
- [[@2018__IMC__A Large Scale Study of Data Center Network Reliability]]
- [[@2016__SoCC__Why Does the Cloud Stop Computing - Lessons from Hundreds of Service Outages]]
- [[@2009__SIGCOMM__PortLand - A Scalable Fault-Tolerant Layer 2 Data Center Network Fabric]]
- [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]](§2.2, §5.2: OCS ベース再構成・日次故障率内訳・システム可用性 99.98%)