# 分散
Navigation: [[index]] | [[overview]]
## 定義
確率変数 R の**分散(variance)** Var[R] は、R の平均からの偏差の二乗の期待値として
Var[R] := Ex[(R - Ex[R])^2]
と定義される(平均二乗偏差、mean square deviationとも呼ぶ)。R が平均の近くに集中していれば小さく、平均から大きく外れることが多ければ大きくなる。分散は元の変数の単位の二乗を持つため(例: ドル建ての変数の分散は「平方ドル」)、単位を揃えるために平方根をとった**標準偏差(standard deviation)** σ_R := √Var[R] を用いることが多い。標準偏差は「平均二乗偏差の平方根(root mean square deviation)」であり、鐘型の分布では平均の周りの O(σ_R) サイズの範囲に「主要部分」が収まることを表す。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.2.2)
分散には計算しやすい等価な公式 Var[R] = Ex[R^2] - Ex^2[R] があり、これは Ex[(R-μ)^2] を展開し期待値の線形性を適用するだけで証明できる(μ := Ex[R])。この公式から、値が0/1しかとらないベルヌーイ変数 B(Pr[B=1]=p)については B^2=B なので Var[B]=p-p^2=p(1-p) が直ちに従う。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.3.1)
分散は定数倍と定数加算に対して次の性質を持つ: 定数 a, b について Var[aR+b] = a^2·Var[R](**Square Multiple Rule**、定数を加えても分散は変わらない)。したがって σ_{aR+b} = |a|·σ_R。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.3.3)
分散の最も重要な性質は和に関する加法性である。R と S が独立であれば Var[R+S] = Var[R] + Var[S] が成り立つ。証明は Ex[R]=Ex[S]=0 に平行移動したうえで(Var[R+S]=Ex[(R+S)^2] に帰着させ)、独立変数の積の期待値の乗法性 Ex[RS]=Ex[R]·Ex[S] を使って展開項 Ex[2RS] を0にする、という手順による。この加法性は**相互独立性ではなく対独立性(pairwise independence)で十分**成り立つという点が実用上重要で、n個の対独立な確率変数 R1,...,Rn の和についても Var[ΣRi] = ΣVar[Ri] が成り立つ(Pairwise Independent Additivity of Variance)。これを使うと、n回の独立コイン投げにおける(n,p)-二項分布に従う確率変数 J の分散は、指示確率変数 Ik(Var[Ik]=p(1-p))の和として J=ΣIk と分解し Var[J]=np(1-p) と直ちに求まる。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.3.4)
分散が独立性を要求する加法性しか持たないという事実は、[[集中不等式]]の**チェビシェフの不等式** Pr[|R-Ex[R]|≥x] ≤ Var[R]/x^2 を通じて、[[確率変数]]の和が平均の周りにどれだけ集中するかを評価する土台になる。標本平均 Sn/n(Sn:=ΣGi、Gi は対独立で同一の平均μ・分散σ^2)については Var[Sn/n]=σ^2/n となり、標本サイズ n を大きくするほど分散が縮小し推定精度が上がる、という**ペアワイズ独立標本抽出定理**(大数の弱法則の証明手段)の核心を担う。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.4.3)
## 横断的知見
- 第18章の[[期待値]]の線形性 Ex[ΣaᵢRᵢ]=ΣaᵢEx[Rᵢ] は確率変数間の**独立性を一切要求しない**のに対し、第19章の分散の加法性 Var[R+S]=Var[R]+Var[S] は(相互独立性までは不要だが)**対独立性を必須とする**という非対称性がある。この非対称性は証明の構造そのものから生じる: 期待値の線形性は和の並べ替え(標本空間上の和の分配則)だけで成り立つのに対し、分散の加法性の証明では独立変数の積の期待値の乗法性 Ex[RS]=Ex[R]Ex[S] という独立性に固有の性質(§18.5.8)を経由して交差項 Ex[2RS] を消す必要があるためである。R=S(完全に従属)の場合には実際に Var[R+R]=4Var[R]≠2Var[R]=Var[R]+Var[R] となり加法性が破れる(Var[R]≠0のとき)ことが、この非対称性を具体的に示す反例になっている。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 18 Random Variables]] §18.5, [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.3.4)
- 誕生日マッチング問題(第16章で導入)の分析は、二項分布のように相互独立な指示確率変数の和では説明できない好例になっている。マッチしたペアの指示確率変数 Ei,j(i<j)は、対独立ではあるが3変数以上では独立ではない(AliceとBobが一致し、AliceとCarolも一致すれば、BobとCarolの一致は論理的に確定してしまう)。それでも対独立性さえあれば Var[M]=Σ Var[Ei,j] という加法性が成立し、Chebyshevの不等式でマッチ数の集中を評価できる。これは、分散の加法性が要求する独立性の水準が(直感に反して)相互独立性より真に弱くてよいことを、誕生日問題という具体例で裏付けている。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.4.2)
- **共分散(covariance)は独立性より弱い「線形な非相関性」の指標である**: [[確率変数]]・分散を扱う MCS の2章(第18-19章)は独立性の仮定のもとでの加法性 Var[R+S]=Var[R]+Var[S] のみを扱い共分散を導入しないが、Jain(第12章)は共分散 Cov(x,y):=E[(x-µx)(y-µy)] と相関係数(共分散の正規化値、-1〜+1)を導入し、「独立ならば共分散は0(E[xy]=E[x]E[y]のため)だが、逆に共分散が0でも従属でありうる」と明示する。これは分散の加法性が独立性(または対独立性)を要求する理由——Var[R+S]の展開に現れる交差項 E[2RS] が独立でない限り消えない——を、Cov(R,S)という名前を持つ量として一般化する構図であり、一般公式 Var[R+S]=Var[R]+Var[S]+2Cov(R,S) の後半項が何であるかを埋める。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.3.4, [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 12 Summarizing Measured Data]] §12.1)
- **和の期待値・分散の非対称性は、離散数学の教科書(MCS)と計算機性能解析の教科書(Jain)の双方で独立に同じ形で述べられる**: MCS第18-19章はこの非対称性を証明付きで示す(本ページ既存の横断的知見を参照)が、Jain第12章 §12.1もこの非対称性を公式の形でそのまま述べている——k個の確率変数の重み付き和の期待値は独立性を仮定せず各期待値の重み付き和に等しい一方、和の分散が各分散の重み付き和になるのは変数が独立な場合に限られる。証明の掘り下げでは前者(MCS)が勝るが、後者(Jain)は測定データの実務(例: 複数リソースのCPU時間の合計と分散)にこの規則が直接適用される文脈を補う。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.3.4, [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 12 Summarizing Measured Data]] §12.1)
- **標本平均の分散 Var[Sn/n]=σ²/n(MCS第19章のペアワイズ独立標本抽出定理)は、Jain(第13章)の信頼区間構成における「標準誤差」の理論的根拠そのものである**: MCS第19章§19.4.3は標本平均Sn/nの分散がσ²/nに縮小し標本サイズnとともに推定精度が上がることを、チェビシェフの不等式による集中評価の文脈で示す(本ページ既存の横断的知見を参照)。Jain第13章§13.2はこの同じ事実を「標準誤差(standard error)」と呼び、母標準偏差σではなくσ/√n(標本からはs/√nで推定)が標本平均の標準偏差であり、これがnとともに小さくなることから信頼区間 x̄ ± z[1-α/2]·s/√n が狭くなると説明する。すなわちMCSが理論(分散の縮小=推定の集中)として示す量が、Jainでは実務手続き(信頼区間の幅を決める標準誤差)としてそのまま現れており、両者は同じ数学的事実 Var[Sn/n]=σ²/n の理論的正当化と実務的応用という関係にある。この対応は本ページの既存の未解決の問い(標準偏差が分布の主要部分の幅を表すという直感の具体化)の一部を、信頼区間という形で埋める。(Source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] §19.4.3, [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 13 Comparing Systems Using Sample Data]] §13.2)
## 未解決の問い
- 標準偏差が「分布の主要部分の幅」を表すという直感的説明(図19.1)は、正規分布のような具体的な連続分布の裾の形と関連付けられるとより明確になるはずである。Jain(第12章・第13章)は連続分布である正規分布N(µ,σ)を導入し付表の分位点で面積を求める方法(信頼区間の構成を含む)には触れるが、68-95-99.7則のような具体的な経験則には触れておらず、この対応は依然として別ソース待ちである。
- 分散が小さいことは集中度が高いことを意味するが、分散が有限であること自体を仮定できない分布(コーシー分布など)への拡張は本章の範囲では扱われていない。
## 関連
- source: [[@2015__MIT__Mathematics for Computer Science - Chapter 19 Deviation from the Mean]] / [[@2015__MIT__Mathematics for Computer Science - Chapter 18 Random Variables]] / [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 12 Summarizing Measured Data]] / [[@1991__Wiley__The Art of Computer Systems Performance Analysis - Chapter 13 Comparing Systems Using Sample Data]]
- 概念: [[期待値]](分散は期待値の上に定義される二次の統計量)、[[確率変数]]、[[二項分布]](分散 np(1-p) の導出例)、[[集中不等式]](分散を使うチェビシェフの不等式)、[[要約統計量の選定]](分散・標準偏差・変動係数をばらつき指標として使うべき場面の実務的な判定規則)、[[信頼区間]](標本平均の分散σ²/nを標準誤差として使う実務手続き)
## 出典
- Eric Lehman, F. Thomson Leighton, Albert R. Meyer, *Mathematics for Computer Science*, revised 2015-05-18, Chapter 19 §19.2.2, §19.3-§19.4.3.
- Raj Jain, *The Art of Computer Systems Performance Analysis*, John Wiley & Sons, 1991, Chapter 12 §12.1(共分散・相関係数、和の期待値・分散の非対称性)。
- Raj Jain, *The Art of Computer Systems Performance Analysis*, John Wiley & Sons, 1991, Chapter 13 §13.2(標本平均の分散σ²/nを標準誤差として信頼区間の構成に使う実務手続き)。