# 平滑化スプライン
## 定義
平滑化スプライン(smoothing spline)とは、結び目の位置と個数を事前に選ぶ問題を回避するため、可能な限り多くの結び目(訓練データの各点)を使いつつ、罰則付き残差平方和
$\mathrm{RSS}(f,\lambda)=\sum_{i=1}^N\{y_i-f(x_i)\}^2+\lambda\int\{f''(t)\}^2\,dt$
を、2階連続微分を持つ関数全体(ソボレフ空間)の上で最小化する手法である。$\lambda=0$ ではデータを補間する任意の関数が許され、$\lambda=\infty$ では2階微分がゼロの単純な最小二乗直線に潰れる。この criterion は無限次元の関数空間上で定義されているにもかかわらず、解は訓練点 $x_i$ を結び目とする有限次元の一意な自然3次スプラインになる、という著しい結果を持つ。自然スプライン基底 $N_j(x)$ を用いて $f(x)=\sum_j N_j(x)\theta_j$ と書けば、criterion は $(y-N\theta)^T(y-N\theta)+\lambda\theta^T\Omega_N\theta$(ただし $\{\Omega_N\}_{jk}=\int N_j''(t)N_k''(t)\,dt$)に帰着し、解 $\hat\theta=(N^TN+\lambda\Omega_N)^{-1}N^Ty$ は一般化ridge回帰である。フィット $\hat f=N\hat\theta=S_\lambda y$ における $N\times N$ 行列 $S_\lambda$ を**平滑化行列**と呼ぶ。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] §5.4)
## 有効自由度と平滑化行列の性質
$S_\lambda$ は対称・半正定値であり、Reinsch形式 $S_\lambda=(I+\lambda K)^{-1}$($K$ は $\lambda$ に依存しない罰則行列)を持つ。固有分解 $S_\lambda=\sum_k \rho_k(\lambda)u_ku_k^T$、$\rho_k(\lambda)=1/(1+\lambda d_k)$ により、平滑化スプラインは $y$ を固有ベクトル基底 $\{u_k\}$ に分解し、成分ごとに異なる強さ $\rho_k(\lambda)$ で縮小する。最初の2固有値は常に1で線形関数の空間(罰則がゼロになる部分空間)に対応し、決して縮小されない。
回帰スプラインの射影行列(hat matrix)$H_\xi$ が冪等($H_\xi H_\xi=H_\xi$、固有値は1かゼロのみ)で「残すか捨てるか」の二値選択を行う**projection smoother**であるのに対し、$S_\lambda$ は $S_\lambda S_\lambda \preceq S_\lambda$ を満たすのみで、固有値が連続的に減衰する**shrinking smoother**である。有効自由度は $\mathrm{df}_\lambda=\mathrm{trace}(S_\lambda)=\sum_k\rho_k(\lambda)$ と定義され、射影平滑化器では次元数(=1の固有値の個数)に一致する一般化になっている。$S_\lambda$ はほぼ帯行列であり、各行を見ると局所支持を持つ**等価カーネル(equivalent kernel)**として解釈できる — これは第6章の局所回帰・カーネル平滑化の考え方を先取りする。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] §5.4.1)
## λの選択とノンパラメトリック回帰への拡張
$\mathrm{df}_\lambda$ は $\lambda$ の単調関数なので、自由度を指定して数値的に $\lambda$ を逆算する方が直感的である。真の期待予測誤差(EPE)は未知なので、leave-one-out交差検証 $\mathrm{CV}(\hat f_\lambda)=\frac1N\sum_i\{(y_i-\hat f_\lambda(x_i))/(1-S_\lambda(i,i))\}^2$ で近似する。この定義は、平滑化行列の対角要素だけから交差検証誤差を計算できるという計算上の利点を持つ。
同じ罰則付き最尤の考え方はロジスティック回帰にも拡張でき、罰則付き対数尤度を最大化する解も訓練点を結び目とする有限次元の自然スプラインになる。Newton-Raphson更新は重み付き平滑化スプラインを作業応答 $z$ へ繰り返し当てはめる形になり、この一般化がChapter 9の一般化加法モデル(GAM)の基礎になる。多次元への一般化は thin-plate spline(罰則が2階偏微分の二乗和の積分になる)であり、正則化理論の一般形としては [[カーネル法]] のRKHS理論に包摂される。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] §5.5, §5.5.1, §5.6, §5.7)
## 横断的知見
- **係数への罰則(第3章)から関数の滑らかさへの罰則(第5章)への拡張**: [[縮小推定]] が扱う ridge/lasso は罰則付き残差平方和 $\sum_i(y_i-x_i^T\beta)^2+\lambda J(\beta)$ において $J(\beta)$ を係数ベクトルのノルムに取るのに対し、平滑化スプラインは同じ「罰則付き最小二乗」という枠組みを保ったまま $J$ を関数の曲率 $\int f''(t)^2dt$ に取り替える。実際、平滑化スプラインの解 $\hat\theta=(N^TN+\lambda\Omega_N)^{-1}N^Ty$ はridge回帰の解 $(X^TX+\lambda I)^{-1}X^Ty$ と同型の一般化ridge回帰であり、$\Omega_N$ が単位行列の代わりに曲率のグラム行列になっている点だけが異なる。[[部分集合選択]]と[[縮小推定]]の対比(離散的な変数選択 対 連続的な係数縮小)も、regression spline(射影平滑化器、離散的)と平滑化スプライン(shrinking smoother、連続的)という形でそのまま関数レベルへ持ち上がる。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] §3.4, [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] §5.4, §5.4.1)
## 未解決の問い
- 平滑化スプラインの有効自由度 $\mathrm{df}_\lambda=\mathrm{trace}(S_\lambda)$ は、[[部分集合選択]] concept が指摘する「部分集合選択の有効自由度には閉形式がない」という問題を、関数選択の文脈でどこまで解決しているか。両者を統一的に扱える一般的な自由度の定義はあるか(Chapter 7で詳述予定)。
- 平滑化行列 $S_\lambda$ の等価カーネル(equivalent kernel、図5.8)と、第6章で扱われる局所回帰のカーネル重み関数は、どの程度厳密に一致するか。
- thin-plate splineとRKHS理論の関係(§5.8.2でthin-plate splineがRBF展開として与えられる)は、第6章・第12章の担当者がカーネル法を深掘りする際にどう接続されるか。
## 関連
- 概念: [[基底展開]](上位の枠組み) / [[縮小推定]] / [[部分集合選択]] / [[カーネル法]](RKHSとしての一般化)
- ソース: [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]]
## 出典
- Hastie, T., Tibshirani, R., Friedman, J., *The Elements of Statistical Learning*, 2nd Edition, Springer, 2009, Chapter 5, §5.4-§5.7.