# Palomar Optical Circuit Switch(OCS)
[[Google]] が開発した、MEMS(micro-electromechanical systems)ミラーのアレイに基づく動的構成可能な N×N 光回線交換機(optical circuit switch)。ミリ秒オーダーで切替可能で、論理的な北側の任意のポートと南側の任意のポートの間でプログラマブルなクロスコネクト(xconnect)を確立できる。あるポート間の接続(Ni-Sj)が確立されると、別のポート組み合わせへ再構成されるまで専用の光リンク接続として機能する([[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]] §2.2)。
OCS の本番データセンターネットワークへの利用そのものは、[[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]] 参考文献[25](Poutievski+, "Jupiter evolving: Transforming google's datacenter network via optical circuit switches and software-defined networking", SIGCOMM 2022)で先行して報告されている。TPUv4 論文は、この OCS を機械学習訓練用 exascale スーパーコンピュータの ICI(inter-chip interconnect)ファブリック再構成に特化して適用した点を新規性として位置づける。
## TPUv4 での配線構成
- 1 台の OCS は 128 ポートを提供し、64 キューブすべてから 1 ポートずつを収容できる。
- **TPUv4 スーパーコンピュータ全体では 64 キューブ × 96 ICI リンク = 6,144 本の光 ICI リンクが 48 台の OCS に接続される**(3 次元 × 16 台/次元)。
- 各 OCS はリング状に対向する 2 か所から各キューブが寄与する 2 本の光 ICI リンクを収容する構成。
- 同じ {dim, index} パラメータを持つ ICI と OCS が対応するため、1台の OCS が不可用になると、全キューブが同じ {dim, index} の ICI リンク1本の断線を観測するという高い対称性を持つ障害パターンが生じる(Figure 10)。
## 信頼性とコスト
- 日次故障率 **0.04%**(TPU マシン0.08%・ICI ケーブル0.005%と比較すると中間の水準)。
- OCS 故障はスーパーコンピュータ内の全キューブに影響しうるためブラスト半径が大きい一方、耐障害 ICI ルーティングによって性能影響を抑えつつ許容できる。他コンポーネントより OCS の復旧優先度を高く設定している。
- OCS と光ファイバのコストは TPUv4 pod の総資本コストの **5%未満**、稼働電力は pod 総電力の **3%未満**であり、InfiniBand 等のパケットスイッチでスケールする代替案より低コストと報告される。
## 関連
- ソース: [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]]
- エンティティ: [[Google]] / [[TPUv4]] / [[Borg]]
- 概念: [[光回線交換]] / [[AIデータセンタートポロジ]] / [[データセンターネットワーク信頼性]]
## 出典
- [[@2024__NSDI__Resiliency at Scale - Managing Google's TPUv4 Machine Learning Supercomputer]](§2.2 TPUv4: OCS-based Reconfigurability, §5.2 Hardware Maintenance Automation, §6 Related Work)