# 可用性 ## 定義 可用性(availability)とは、システムを解析するために測定される、利用可能なデータと解析目的に応じて複数の方法で表現しうる指標である。可用性は信頼性と保守性の合成として定まる。修理と定期予防保全のいずれもシステムを利用可能状態から除外する行為であるため、信頼性(故障の起きにくさ)と保守性(修理・保全の容易さ)は互いに影響し合いながら、両者がともに可用性とコストを規定する(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.1, §16.2)。 ## 3つの可用性尺度 考慮する停止時間の範囲に応じて、少なくとも3つの可用性尺度が区別される。 **固有可用性(inherent availability, AI)**は、是正保全(CM)のみを考慮する定常状態可用性である。 $A_I = \frac{\mathrm{MTBF}}{\mathrm{MTBF} + \mathrm{MTTR}}$ CM行動が一定率で発生すると仮定して推定され、MTBFは平均故障間隔、MTTRは平均修理時間(平均是正保全時間と同義)である。この尺度は第6章§6.7で扱われる修理可能系の定常可用性と同一の式であり、本章はこれを固有可用性という名称のもとで再定義している(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.1)。 **達成可用性(achieved availability, AA)**は固有可用性に近いが、予防保全(PM)による停止時間も含む点が異なる。理想的な支援環境(工具・予備品・要員がすぐに利用できる)における定常状態可用性であり、兵站遅延・供給遅延・管理遅延を含まないという意味で「保全部門から見た可用性」とも呼ばれる。 $A_A = \frac{\mathrm{MTBMA}}{\mathrm{MTBMA} + \mathrm{MMT}}$ MTBMA(平均保全行動間隔。是正・予防の両方を含む)は一定故障率を仮定すると $\mathrm{MTBMA} = \frac{1}{\lambda + f_{PM}}$ で計算できる(λは故障率、$f_{PM}$は予防保全の頻度、すなわちPM周期の逆数)。平均保全時間MMTは是正保全と予防保全それぞれの寄与に分解できる。 $\mathrm{MMT} = \frac{\lambda\,\mathrm{MTTR} + f_{PM}\,\mathrm{MPMT}}{\lambda + f_{PM}}$ MTTRは平均是正保全時間、MPMTは平均予防保全時間である(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.2)。 **運用可用性(operational availability, AOp)**は、実際の運用環境における期間平均の「実質的な」可用性の尺度であり、管理上の停止時間・兵站上の停止時間など、経験されたあらゆる停止要因を含む。 $A_{Op} = \frac{\mathrm{MTBMA}}{\mathrm{MTBMA} + \mathrm{MDT}}$ MDT(平均保全停止時間)はMMTに兵站遅延時間と管理遅延時間を加えたものである(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.3)。 3尺度は固有可用性(CMのみ)⊂達成可用性(CM+PM、理想的支援環境)⊂運用可用性(CM+PM+兵站・管理遅延)という包含関係にあり、考慮する停止要因の範囲が段階的に広がる構造になっている。 ## Example 16.1 故障率1000時間あたり1回、予防保全を500時間ごとに実施(平均6時間)、修理に平均16時間を要するシステムの達成可用性を計算する例が示される。$f_{PM}=1/500\mathrm{h}=0.002\,\mathrm{h}^{-1}$、$\lambda=1/1000\mathrm{h}=0.001\,\mathrm{h}^{-1}$から、MTBMA=333.33h、MMT=9.33h、$A_A=333.33/(333.33+9.33)=0.973$と計算される(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.2、Example 16.1)。 ## 信頼性成長下の可用性の時間発展(更新理論による導出) [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] §2.4.4 は、可用性を固定の1つの数値としてではなく、信頼性成長のもとで**時間とともに変化する量**として更新理論から導出する。保守方策として「故障のたびに改修」($a_j=1$)、故障時間と復旧時間がともに指数分布に従い、区分的ポアソン過程が $r$ 回の改修後にポアソン過程へ収束するという仮定のもとで、不可用性 $\bar A(t)=1-A(t)$ のラプラス変換を漸近展開すると、次の式が得られる(式2.17)。 $\bar A(t) = \frac{\lambda_r}{\mu_r} + \sum_{j=1}^{r-1}\alpha_j\exp(-\lambda_j t) - \frac{\lambda_1}{\mu_1}\exp(-\mu_1 t)$ ここから次の6性質(P1-P6)が導かれる。P1: 信頼性が安定すれば不可用性は定数 $\bar A(\infty)\approx\lambda_r/\mu_r$ に収束する。P2: 初期の故障率対復旧率の比 $\lambda_1/\mu_1$ が漸近値 $\lambda_r/\mu_r$ 以上なら不可用性のオーバーシュートが生じる。P3: 逐次の $\lambda_j/\mu_j$ が単調非増加なら不可用性の極大は1つだけ生じる(そうでなければ局所的な極大・極小が生じうる)。P4: 故障率が単調非増加かつ故障時間が復旧時間より十分大きければ最大不可用性は $\bar A_{max}\approx\lambda_1/\mu_1$。P5: 最大不可用性への到達時間は平均復旧時間 $1/\mu_1$ のオーダー。P6: 可用性の変動は復旧時間の確率的変化よりも故障時間の確率的変化に強く支配される。この結果、信頼性成長下の典型的な不可用性曲線は、急上昇して極大に達したのち漸近値へ緩やかに減衰する形状を取る(Fig 2.15)。(Source: [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] §2.4.4) ## 横断的知見 - **Laprie&Kanounの漸近的不可用性 $\bar A(\infty)\approx\lambda_r/\mu_r$ は、$\lambda\ll\mu$ の近似のもとで第16章の固有可用性 $A_I=\mathrm{MTBF}/(\mathrm{MTBF}+\mathrm{MTTR})$ の不可用性側と数式的に一致する**: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.1 の固有可用性は $A_I=\mu/(\lambda+\mu)$($\mu=1/\mathrm{MTTR}$、$\lambda=1/\mathrm{MTBF}$)であり、不可用性は $1-A_I=\lambda/(\lambda+\mu)$。[[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] §2.4.4 が置く「故障時間が復旧時間より十分大きい」($\lambda_j/\mu_j\ll1$)という前提のもとでは $\lambda/(\lambda+\mu)\approx\lambda/\mu$ となり、Laprie&Kanounの漸近式 $\bar A(\infty)\approx\lambda_r/\mu_r$(最終的な、信頼性が安定した後の故障率 $\lambda_r$ と復旧率 $\mu_r$ を用いる)と一致する。すなわち第16章の固有可用性は、Laprie&Kanounのモデルにおいて「信頼性成長が収束しきった後の定常状態」における不可用性の近似値に相当し、両者は独立に導出されながら同一の極限へ収束する関係にある。ただし第16章のモデルは時間に依存しない単一の定常値を扱うのに対し、Laprie&Kanounのモデルは信頼性成長の過程で不可用性が単調でなく変化すること(初期の急上昇と極大の存在、P1-P5)まで捉える点で、より一般的である。(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.1, [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] §2.4.4) - **第16章の3尺度(固有・達成・運用可用性)はいずれも「考慮する停止要因の範囲」による分類であるのに対し、Laprie&Kanounの分析は「時間発展」という異なる軸を導入する**: [[システム信頼性モデル]] concept が整理するとおり、第16章の3尺度は是正保全のみ→予防保全を含む→運用上の全遅延を含む、という**空間的(要因の範囲)**な粒度の違いである。これに対しLaprie&Kanounの P1-P6 は、同一の可用性尺度(是正保全のみを想定した固有可用性に相当)が信頼性成長の過程で**時間的に**どう推移するかを記述する。両者は直交する軸(範囲 対 時間)から可用性を分解しており、実務では「どの範囲の停止要因を含めるか」と「システムのライフサイクルのどの時点を評価するか」の両方を明示しないと、可用性の数値だけでは比較不能であることが示唆される。(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.1-§16.2.3, [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] §2.4.4) - **本書自身が固有可用性の式を第6章§6.7と同一の式として明示的に接続している**: 第16章§16.2.1は固有可用性$A_I=\mathrm{MTBF}/(\mathrm{MTBF}+\mathrm{MTTR})$を定義する際、本文中で「covered in Section 6.7」と明記し、[[システム信頼性モデル]]がまとめる第6章§6.7の修理可能系の定常可用性$A=\mu/(\lambda+\mu)$と数式的に同一の関係であることを本文が自ら示している。ただし第6章はこの式を「修理可能系の信頼性に相当する概念」として単一の可用性概念で導入するのに対し、第16章はこれを固有可用性という名称で位置づけたうえで、達成可用性・運用可用性という2つの拡張(それぞれ予防保全、兵站・管理遅延を追加で考慮する)を導入する。つまり第6章の可用性は本章の3尺度のうち最も狭い「固有可用性」に相当し、両章を合わせて読むことで、可用性が「是正保全のみ→予防保全を含む→運用上の全遅延を含む」という3段階の粒度を持つ概念であることが明らかになる(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 6 Reliability Prediction and Modelling]] §6.7, [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.2.1)。 - **冗長化と保守性向上の関係も両章で補い合う**: [[システム信頼性モデル]]は第6章§6.7の知見として「BITE(built-in test equipment)による修理時間短縮は可用性を高めうる一方、それ自体が複雑さの増大による信頼性低下や偽陽性の故障表示を招きうるトレードオフを持つ」と記す。第16章§16.7.5はこのトレードオフをBIT(built-in test)という同一の技術について、より詳細に(BIT自身の構成要素の故障が誤った故障表示を生む、BITは必須機能の監視に限定すべき、等)展開している。両章を合わせると、可用性向上のための保守性設計(BIT導入)が信頼性側にコストを課すという構造が、第6章では可用性モデルの文脈で、第16章では保守性設計の文脈で、独立に確認できる(Source: [[@2012__Wiley__Practical Reliability Engineering - Chapter 6 Reliability Prediction and Modelling]] §6.7, [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] §16.7.5)。 ## 未解決の問い - Laprie&Kanounの P1-P6(§2.4.4)は固有可用性に相当する尺度(是正保全のみ)についてのみ導出されている。第16章の達成可用性・運用可用性(予防保全・兵站/管理遅延を含む)に対応する時間発展モデルは本章・[[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] のいずれにも存在しない。予防保全のタイミング($a_j=0$ の特殊ケース)を組み込んだ場合、P1-P6はどう修正されるか。 - 達成可用性の式(16.2)-(16.4)は故障率λと予防保全頻度$f_{PM}$がいずれも一定であることを仮定するが、バスタブ曲線([[バスタブ曲線]]参照)が示すように故障率は時間とともに変化しうる。この仮定が崩れる場合の可用性推定の扱いは本章では示されていない。 - 運用可用性MDTに含まれる「管理遅延時間(administrative delay time)」の内訳や典型的な大きさについて、本章は具体例を示していない。 - 固有可用性・達成可用性・運用可用性という3尺度の使い分けについて、どの尺度を契約上の可用性要求として用いるべきかの実務的指針は本章では示されていない。 ## 関連 - 概念: [[保守性]] / [[予防保守]] / [[システム信頼性モデル]] / [[ディペンダビリティ]] - 実体: [[Patrick D. T. O'Connor]] / [[Andre Kleyner]] / [[Jean-Claude Laprie]] / [[Karama Kanoun]] - ソース: [[@2012__Wiley__Practical Reliability Engineering - Chapter 16 Maintainability, Maintenance and Availability]] / [[@1996__McGrawHill__Handbook of Software Reliability Engineering - Chapter 2 Software Reliability and System Reliability]] - 書籍: [[wiki/entities/Practical Reliability Engineering|Practical Reliability Engineering]] / [[wiki/entities/Handbook of Software Reliability Engineering|Handbook of Software Reliability Engineering]] ## 出典 - P. D. T. O'Connor and A. Kleyner, *Practical Reliability Engineering*, 5th ed., Wiley, 2012, Chapter 16 §16.2-§16.2.3. - Jean-Claude Laprie and Karama Kanoun, "Software Reliability and System Reliability", in *Handbook of Software Reliability Engineering*, IEEE CS Press / McGraw-Hill, 1996, Chapter 2, §2.4.4.