# 紹介: Internet Service Performance Failure Detection
Navigation: [[index]] | [[wiki/sources/@1998__PER__Internet Service Performance Failure Detection|Internet Service Performance Failure Detection(source)]]
## 紹介文
- ネットワークサービスの複雑化と依存度の高まりで、利用者に影響する性能障害を早く見つけることが重要になっている。
- しかし、実運用データには日内・週次の揺らぎがあり、強い独立同分布の仮定に頼らず異常を検知する必要がある。
- 手法はプロキシの15分ごとのリクエスト数を時間帯別の平均と分散で標準化し、Zスコアの上下の逸脱を障害候補として捉える。
- 既知障害を除いて時間帯ごとの分布を学習し、単一観測の即時判定と直近N点の窓による早期警告を使い分ける。
- DEC社内の2台のプロキシと1万台超のクライアントを対象に、1997年6月から10月までの12週間の実運用データで検証した。
- リクエスト率に加えてEstablished・Syn_Sent・Syn_RcvdのTCP接続状態も調べ、障害検知と原因切り分けを評価した。
- 単一観測法は検証データで障害の90%を検知し、誤警報は2件だった。
- 窓法は同じく90%を検知しながらより早く警告できた一方、誤警報は3件に増えた。
- TCP接続状態を組み合わせると、内部ネットワークの異常とプロキシサーバ単体の障害を区別でき、再起動後のキャッシュ再構築による処理低下も説明できた。
- 少数の運用計測値と簡単な統計モデルでも実障害を捉えられるが、計測粒度や閾値の選定、複数変数を使った診断の自動化は今後の課題として残る。
---
Amy Ward et al. (Engineering Economic Systems / Operations Research Department, Stanford University), "Internet Service Performance Failure Detection," Performance Evaluation Review:Vol. 26, No. 3, pp. 38-44, 1998. https://web.stanford.edu/~glynn/papers/1998/WGR98.pdf
## 出典
- [[wiki/sources/@1998__PER__Internet Service Performance Failure Detection|Internet Service Performance Failure Detection]]