# 縮小推定 > [!note] 認知科学・科学哲学の文脈で「多次元データを人間が理解できる低次元表現へ写像する操作」を指す [[縮約]] とは**別概念**である。本ページは統計的推定における shrinkage(係数を0へ連続的に近づける正則化手法群)を扱う。 ## 定義 縮小推定(shrinkage estimation)とは、回帰係数の大きさに罰則を課すことで最小二乗推定量を0の方向へ連続的に縮める推定法の総称であり、[[部分集合選択]]の**離散的な**変数の取捨選択に対し、**連続的**にモデルの複雑さを制御する点が対比される。罰則付き残差平方和 $\sum_i(y_i - \beta_0 - \sum_j x_{ij}\beta_j)^2 + \lambda J(\beta)$ を最小化する枠組みで統一的に記述でき、罰則関数 $J(\beta)$ の形(L2かL1かその混合か)が手法を分ける。バイアスをわずかに増やす代わりに分散を大きく減らせるなら、平均二乗誤差(MSE)の観点で最小二乗より優れる、というGauss–Markov定理の系(不偏推定量の中では最小二乗が分散最小だが、バイアスを許す推定量はさらに優れうる)が理論的動機になる。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] §3.2.2, §3.4) ## 主な手法と制約領域の幾何 | 手法 | 罰則 $J(\beta)$ | 制約領域の形 | 変数選択 | |---|---|---|---| | ridge回帰 | $\sum_j \beta_j^2$(L2) | 円盤・球 | しない(角がなく係数は厳密に0にならない) | | lasso | $\sum_j \|\beta_j\|$(L1) | 菱形・多面体 | する(角で解が座標軸上に乗る) | | elastic net | $\alpha\sum_j\beta_j^2 + (1-\alpha)\sum_j\|\beta_j\|$ | 円盤と菱形の中間 | する(lasso寄り)、相関変数はグループで縮小 | | $L_q$罰則($q\in(0,2)$) | $\sum_j \|\beta_j\|^q$ | $q\le1$で凸(角あり)、$q>1$で滑らか | $q\le1$でする | 制約領域が**角を持つかどうか**が変数選択能力を決める、というのが核心の論点である。$q=1$(lasso)が制約領域が凸になる最小の $q$ であり、$q<1$ は非凸制約となり最適化が難しくなる。ridge回帰はSVD $X=UDV^T$ を通じて見ると、主成分方向の座標を分散が小さい方向ほど強く縮小する($d_j^2/(d_j^2+\lambda)$ 倍)。ガウス事前分布のもとではridge推定量はMAP推定かつ事後平均に一致するが、lassoと部分集合選択はMAPではあっても事後平均ではない。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] §3.4.1, §3.4.3) ## 横断的知見 - **係数への罰則(第3章)が関数の滑らかさへの罰則(第5章)へそのまま拡張される**: 第3章のridge回帰は罰則付き残差平方和 $\sum_i(y_i-x_i^T\beta)^2+\lambda\sum_j\beta_j^2$ を最小化する「係数ベクトルのL2ノルムを罰する」正則化だが、第5章の[[平滑化スプライン]]は同じ「罰則付き最小二乗」の枠組みを保ったまま、罰則を係数のノルムから関数の曲率 $\lambda\int f''(t)^2dt$ に置き換える。自然スプライン基底で表現すると解は $\hat\theta=(N^TN+\lambda\Omega_N)^{-1}N^Ty$ という一般化ridge回帰になり、ridge回帰の $(X^TX+\lambda I)^{-1}X^Ty$ と同型である――罰則行列が単位行列 $I$ から曲率のグラム行列 $\Omega_N$ に変わっただけである。「バイアスを増やして分散を減らす」という縮小推定の動機は、パラメトリックな係数空間だけでなく無限次元の関数空間でも同じ数学的形で成立する。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] §3.4, [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] §5.4) - **RKHSの理論はridge/lassoと平滑化スプラインの双方を包摂する一般形を与える**: 第5章§5.8は罰則付き損失最小化 $\min_f\sum_iL(y_i,f(x_i))+\lambda J(f)$ という一般形を再生核ヒルベルト空間(RKHS)の理論として定式化し、正則化のカーネル $K$ を多項式カーネルに取れば多項式回帰の縮小推定に、ガウスカーネルに取れば動径基底関数展開の縮小推定になることを示す。第3章のridge回帰は、この一般形において $K(x,y)=\langle x,y\rangle$(線形カーネル)を選んだ特殊ケースとして位置づけられる。詳細は [[カーネル法]] を参照。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] §5.8, §5.8.2) - **高次元($p\gg N$)では、必要な縮小の強さそのものが$p$に応じて連続的に増える**: 第3章・第5章は罰則の「形」(L2かL1か、係数かノルムか)を主題としたが、第18章の$p\gg N$シミュレーション(図18.1)は「罰則の強さ」自体が$p/N$比に応じて調整されるべきことを数値で示す。$p=20$では弱い正則化(有効自由度20)が最良、$p=1000$では強い正則化(有効自由度43、$p$の4%程度)が最良になり、最適なridge推定量の係数の$t$統計量の中央値は$p$が増すごとに2.0→0.6→0.2と単調に下がる。つまり第3章の「バイアスをわずかに増やして分散を大きく減らす」という動機が、$p\gg N$では「バイアスを大きく増やして分散を大きく減らす」方向へ連続的にスライドする。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] §3.4, [[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]] §18.1) - **共分散行列の縮小(RDA)は係数ベクトルの縮小(ridge)と同型の操作である**: 第18章§18.3.1の正則化判別分析(RDA)は、共分散行列を対角成分へ縮小する$\hat\Sigma(\gamma)=\gamma\hat\Sigma+(1-\gamma)\mathrm{diag}(\hat\Sigma)$という操作を導入する。これは第3章のridge回帰が特徴量の共分散構造全体を「係数ベクトルの縮小」という形で扱うのに対し、「共分散行列そのものを対角行列(独立性の仮定)へ縮小する」という、縮小推定の対象を係数からモデルの仮定そのものへ広げた変種である。$\gamma=0$は診断的LDA(独立性を完全に仮定)、$\gamma=1$は無正則化のLDAに対応し、両端の間を連続的に補間する点でridge回帰の$\lambda\to\infty$/$\lambda\to0$と同じ構造を持つ。また第18章のfused lasso(§18.4.2)は、通常のL1罰則$\lambda_1\sum_j|\beta_j|$に隣接係数差への罰則$\lambda_2\sum_j|\beta_{j+1}-\beta_j|$を加えることで、特徴量に順序がある場合(ゲノム上の位置、質量電荷比等)に縮小推定の罰則関数$J(\beta)$をさらに拡張する具体例を与える。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]] §18.3.1, §18.4.2) - **サポートベクターマシン(SVM)は、罰則の形(L2)を変えずに損失関数だけをヒンジ損失に取り替えた縮小推定である**: 第12章§12.3.2は、SVMの間隔最大化定式化(§12.2)が $\min_{\beta_0,\beta}\sum_i[1-y_if(x_i)]_++\frac{\lambda}{2}\|\beta\|^2$(式12.25、$\lambda=1/C$)という「損失+罰則」の形に書き直せることを示す。これは本ページが第3章・第5章から確立してきた縮小推定の一般形 $\sum_iL(y_i,f(x_i))+\lambda J(\beta)$ にそのまま当てはまり、ridge回帰(二乗誤差損失)・平滑化スプライン(二乗誤差損失+曲率罰則)と同じ枠組みでありながら、損失関数だけがヒンジ損失 $[1-yf]_+$ に置き換わっている点が独自である。ヒンジ損失は他の縮小推定の損失関数(二乗誤差・二項逸脱度)と異なり、クラス事後確率の変換ではなく分類器 $G(x)$ そのものを推定する(Table 12.1)。この違いは、縮小推定という共通の正則化構造の中でも「何を推定するか」は損失関数の選択に依存し、罰則の選択(バイアス-バリアンストレードオフの制御)とは独立に決まることを示す好例である。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 12 Support Vector Machines and Flexible Discriminants]] §12.3.2) - **「bet on sparsity」原理は、本ページが確立してきた「罰則の形(L1かL2か)が変数選択能力を決める」という幾何学的な議論に、高次元データでの手法選択という実践的な帰結を与える**: 本ページの「主な手法と制約領域の幾何」節は制約領域が角を持つかどうかで変数選択の有無が決まると述べるが、第16章§16.2.2はこれを一歩進め、**どちらの罰則を選ぶべきかは真の係数がスパースか密かに依存する**という定量的な指針を与える。10,000データ点・100万個の基底関数というシミュレーションで、真の係数がガウス分布から生成される(密)ならベイズ的に最良なのはridge(L2)だが、非零係数が少数(疎)ならlasso(L1)が優る。決定的なのは、密な設定では十分なデータがないためどちらの罰則も良い性能を出せない、という非対称性である。したがって「bet on sparsity」原理は「密な問題ではどの手法もうまくいかないのだから、疎な問題でうまくいく手法(L1罰則)を選べ」という高次元での実践的帰結として定式化される。これは本ページのridge対lassoの幾何学的対比に、いつどちらを選ぶべきかという判断基準を追加するものである。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 16 Ensemble Learning]] §16.2.2) - **第18章のRDA($\gamma$による共分散行列の縮小)の定義上の起点は、第4章がすでに与えている2パラメータ族である**: 本ページは第18章§18.3.1のRDAを「共分散行列を対角成分へ縮小する $\hat\Sigma(\gamma)=\gamma\hat\Sigma+(1-\gamma)\mathrm{diag}(\hat\Sigma)$」として記録していたが、この操作の**定義そのもの**は第4章§4.3.1がFriedman (1989)の原論文に基づき先に導入している。第4章はまず $\hat\Sigma_k(\alpha)=\alpha\hat\Sigma_k+(1-\alpha)\hat\Sigma$(式4.13)でクラスごとの共分散をLDAの共通共分散(pooled covariance)へ縮小し($\alpha=0$でLDA、$\alpha=1$でQDA)、続けて共通共分散 $\hat\Sigma$ 自体をスカラー共分散 $\hat\sigma^2I$ へ縮小する $\hat\Sigma(\gamma)=\gamma\hat\Sigma+(1-\gamma)\hat\sigma^2I$(式4.14)を導入し、これを式4.13に代入することで $(\alpha,\gamma)$ の2パラメータ族が得られると述べる。すなわち「クラス間の縮小(α)」と「共通共分散のさらなる縮小(γ)」という**二段階の縮小推定**が本来のRDAの構造であり、第18章の記述はこのうちγ側を高次元(遺伝子発現データ)向けに**スカラー共分散ではなく対角共分散**へ縮小するよう特化したものと解釈できる。両章の縮小先(スカラー vs 対角)の違いは矛盾ではなく、pの大小に応じて縮小のターゲットを調整する実践的なバリエーションである。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 4 Linear Methods for Classification]] §4.3.1, [[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]] §18.3.1) - **graphical lassoは、縮小推定の対象を「係数ベクトル」から「精度行列(逆共分散行列)」へ広げた変種であり、罰則が課される対象が変わっても「L1罰則が疎性を生む」という核心の機構は保たれる**: 本ページのridge/lassoは係数ベクトル$\beta$に罰則を課す縮小推定だが、第17章§17.3.2のgraphical lassoは罰則付き対数尤度 $\log\det\Theta-\mathrm{trace}(S\Theta)-\lambda\|\Theta\|_1$ を最大化することで、精度行列$\Theta=\Sigma^{-1}$という**行列パラメータ**に同じL1罰則を課す。第3章のlassoが係数を0にする(=説明変数をモデルから除外する)のに対し、graphical lassoは$\Theta$の非対角成分を0にする(=対応する2変数の辺をグラフから除外する、すなわち条件付き独立とみなす)。実際、graphical lassoの解法アルゴリズム(Algorithm 17.2)は、本ページが確立してきた「lassoの座標降下法によるソフト閾値更新」(式17.26)をそのまま流用し、罰則行列を単位行列ではなく現在推定中の共分散行列$W_{11}$に置き換えることで導出される。これは本ページが第5章の平滑化スプラインで見た「罰則行列が$I$から$\Omega_N$へ変わるだけで同じ縮小推定の数学的形が保たれる」というパターンの、さらに別の実例である――対象がベクトル係数から行列パラメータへ移っても、L1罰則が疎な解を生むという幾何学的機構(制約領域の角)は保たれる。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 17 Undirected Graphical Models]] §17.3.2) - **ニューラルネットワークの重み減衰(weight decay)は、対象が線形モデルの係数から非線形モデルの全結合重みへ変わっても、罰則の数式そのものは第3章のridge回帰と同一である**: [[@2009__Springer__The Elements of Statistical Learning - Chapter 11 Neural Networks]] §11.5.2は、誤差関数に罰則 $J(\theta)=\sum_{km}\beta_{km}^2+\sum_{m\ell}\alpha_{m\ell}^2$(式11.16)を加える重み減衰を導入し、本文中で明示的に「線形モデルに使われるridge回帰の類推(analogous to ridge regression)」と述べる。これは本ページが確立してきた罰則付き最小二乗 $\sum_iL(y_i,f(x_i))+\lambda J(\beta)$ の一般形にそのまま当てはまり、$J$がL2ノルムである点もridge回帰と同型である。異なるのは、罰則が線形結合の係数ではなく、非線形なシグモイド関数を経由する全結合重み($\alpha$:入力→隠れ層、$\beta$:隠れ層→出力)に課される点で、モデルが非凸・非線形になっても「L2罰則が過学習を防ぐ」という縮小推定の核心の機構は保たれる。第11章はさらに、より小さい重みをより強く縮める「重み消去罰則」$J(\theta)=\sum\beta_{km}^2/(1+\beta_{km}^2)+\sum\alpha_{m\ell}^2/(1+\alpha_{m\ell}^2)$(式11.17)という変種も示すが、これは通常のL2罰則と異なり大きな重みへの縮小が頭打ちになる非凸な罰則であり、本ページの「制約領域の幾何」(L2=円盤、L1=菱形)のどちらとも異なる第3の形状を持つ。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] §3.4.1, [[@2009__Springer__The Elements of Statistical Learning - Chapter 11 Neural Networks]] §11.5.2) ## 未解決の問い - ニューラルネットワークの重み消去罰則(weight elimination penalty、式11.17)は大きな重みへの縮小が頭打ちになる非凸な罰則だが、本ページの「制約領域の幾何」(L2=円盤・L1=菱形)の枠組みにこの罰則の制約領域はどう位置づけられるか。lassoのように変数(この場合は重み)選択の性質を持つか。 - ridge・lasso・elastic netの選択は、経験的にはPCR/PLS/ridgeが似た挙動を示す一方lassoがbest subsetとridgeの中間的挙動を示す(ESL Ch.3 §3.6)と述べられているが、この「中間性」を定量化する指標はあるか。 - 縮小推定の罰則パラメータ選択(交差検証、1標準誤差則)は、[[統計的機械学習]] が扱うより広い正則化・モデル選択の枠組み(AIC/BIC等)とどう整合するか。 - 第5章のウェーブレット平滑化(SUREシュリンケージ)はソフト閾値処理としてlassoと数学的に同一の解を持つ(ESL Ch.5 §5.9)。第18章の最近傍縮小重心法(§18.2)も同じソフト閾値関数$\mathrm{sign}(x)(|x|-\Delta)_+$を使う。この等価性は、直交基底(ウェーブレット・主成分)上での縮小推定に限って成り立つのか、一般の相関した基底でも近似的に成り立つのか。 - 第18章のRDA($\gamma$による共分散行列の縮小)とridge回帰(係数ベクトルの縮小)は同型の構造を持つことが分かったが、両者を統一的に扱う一般形(例えば§5.8のRKHS一般形のような)は本書の範囲では明示的に与えられていない。第4章§4.3.1でRDAが本来 $(\alpha,\gamma)$ の2パラメータ族(クラス間の縮小と共通共分散のさらなる縮小)であることは分かったが、この2パラメータ族とridge/lassoの罰則関数 $J(\beta)$ を同じ一般形に載せる統一はまだ与えられていない。 ## 関連 - 概念: [[部分集合選択]] / [[最小角回帰]] / [[統計的機械学習]] / [[平滑化スプライン]](関数空間への拡張) / [[基底展開]] / [[カーネル法]](RKHSとしての一般化) / [[サポートベクターマシン]](ヒンジ損失による縮小推定の変種) / [[アンサンブル学習]]([[勾配ブースティング]]の正則化パスとしての縮小推定) / [[線形判別分析]](RDAが縮小する対象そのもの) / [[無向グラフィカルモデル]](graphical lassoが縮小推定を精度行列へ適用した変種) / [[誤差逆伝播法]](重み減衰による正則化と併用される最適化手続き) - ソース: [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 4 Linear Methods for Classification]](RDAの原論文由来の$(\alpha,\gamma)$定義) / [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 11 Neural Networks]](重み減衰=ridge回帰の類推) / [[@2009__Springer__The Elements of Statistical Learning - Chapter 12 Support Vector Machines and Flexible Discriminants]](ヒンジ損失+L2罰則) / [[@2009__Springer__The Elements of Statistical Learning - Chapter 16 Ensemble Learning]](bet on sparsity原理) / [[@2009__Springer__The Elements of Statistical Learning - Chapter 17 Undirected Graphical Models]](graphical lasso: 精度行列へのL1罰則) / [[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]](p≫Nでの正則化強度・RDA・fused lasso) - 別概念(要注意): [[縮約]](認知科学・科学哲学の文脈。本ページとは別概念) ## 出典 - Hastie, T., Tibshirani, R., Friedman, J., *The Elements of Statistical Learning*, 2nd Edition, Springer, 2009, Chapter 3, §3.4; Chapter 4, §4.3.1; Chapter 5, §5.4, §5.8; Chapter 11, §11.5.2; Chapter 12, §12.3.2; Chapter 16, §16.2.2; Chapter 17, §17.3.2; Chapter 18, §18.1, §18.3.1, §18.4.2.