## 定義 局所回帰(local regression)とは、目標点$x_0$ごとにその近傍の観測値だけへカーネル関数$K_\lambda(x_0,x_i)$で重みを与え、単純なモデル(定数・多項式など)を個別に当てはめることで柔軟な関数推定を実現する手法群を指す。[[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]]は、最も単純な形であるNadaraya-Watson核加重平均 $ \hat f(x_0)=\frac{\sum_{i=1}^N K_\lambda(x_0,x_i)y_i}{\sum_{i=1}^N K_\lambda(x_0,x_i)} $ から出発し、局所線形回帰・局所多項式回帰・局所尤度モデル・変動係数モデルへと一般化する。局所線形回帰は目標点$x_0$で重み付き最小二乗$\min_{\alpha,\beta}\sum_i K_\lambda(x_0,x_i)[y_i-\alpha(x_0)-\beta(x_0)x_i]^2$を解き、解は$\hat f(x_0)=\sum_i l_i(x_0)y_i$という線形推定量(等価カーネル, equivalent kernel)になる。Nadaraya-Watson平均は境界付近で系統的バイアスを持つが、局所線形回帰は等価カーネルを非対称に自動調整してこのバイアスを一次まで正確に補正する(automatic kernel carpentry)。局所多項式回帰(次数$d$)はさらに高次の曲率バイアスも補正できるが、次数を上げるほど分散が増加するというバイアス-バリアンストレードオフを伴う。局所回帰はモデル全体が訓練データそのものであるメモリベース手法(memory-based method)であり、評価時にすべての計算を行う。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]] §6.1) ## 横断的知見 - **局所回帰の構造化カーネル(第6章)と最近傍法のDANN(第13章)は、どちらも「距離計量を変形する」点で共通するが、変形の自由度が異なる**: 第6章 §6.3の構造化カーネル$K_{\lambda,A}(x_0,x)=K\left(\frac{(x-x_0)^TA(x-x_0)}{\lambda}\right)$は、計量行列$A$を座標ごとのスケール(対角行列、または少数の主成分方向)に制限することが多く、データ全体に対して1つの$A$を事前に決める。これに対し[[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]] §13.4の判別適応最近傍法(DANN)は、クエリ点ごとの局所的なクラス内・クラス間共分散行列から計量$\Sigma$(式13.8-13.9)を都度計算する、非対角成分(共分散に基づく回転)を含む一般的な変形であり、しかもクエリ点ごとに異なる。局所回帰が「1つの目的関数(残差二乗和)を安定させるための大域的な計量調整」を志向するのに対し、DANNは「クエリ点周辺の局所的な判別構造(クラス分離方向)を直接反映させる計量」を志向する点で、同じ「距離計量の変形」という発想の異なる実装と言える。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]] §6.3, [[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]] §13.4) - **局所回帰のNadaraya-Watson推定量とk最近傍法は、ともに近傍平均という同じ操作の異なるバリエーションである**: 第6章のNadaraya-Watson核加重平均$\hat f(x_0)=\sum_i K_\lambda(x_0,x_i)y_i/\sum_i K_\lambda(x_0,x_i)$は、固定した帯域幅$\lambda$の中の点を連続的な重みで平均する。第13章のk最近傍法は、逆に固定した点数$k$のもとで到達する距離(帯域幅)がクエリ点ごとに可変になる、いわば「可変帯域幅・二値重み」の局所平均化である。両者は「近傍の定義を固定するか、近傍のサイズを固定するか」という対称的な設計選択の違いにすぎず、[[バイアス-バリアンストレードオフ]]の横断的知見が指摘する「k-NNの$k$と局所回帰の$\lambda$はモデル複雑度を調整する同型のつまみ」という関係を、距離計量の変形という観点からも裏づける。(Source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]] §6.1, [[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]] §13.3) ## 未解決の問い - 局所回帰の帯域幅選択に交差検証・GCV・$C_p$を適用する具体的な計算量・実装上の注意は第7章でどう展開されるか。 - 加法モデルのバックフィッティングにおいて、各ステップの1次元局所回帰の帯域幅を個別に選ぶ場合と共通の値を使う場合とで、収束性・最終的なバイアス-バリアンス特性はどう変わるか(第9章で検証)。 - 局所多項式回帰の次数選択について、「漸近的には奇数次が偶数次を支配する」という理論的知見は有限サンプルでどこまで実務的な指針として使えるか。 - DANNのような非対角的・クエリ点ごとの適応的計量を、局所回帰(連続値の回帰)にそのまま適用した場合の性能は本書では検証されていない。第13章は分類設定でのみDANNを評価しており、回帰設定への一般化は未確認。 ## 関連 - source: [[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]] / [[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]](DANN・k最近傍法との対比) - concept: [[バイアス-バリアンストレードオフ]] / [[次元の呪い]] / [[カーネル法]] / [[カーネル密度推定]] / [[最近傍法]] ## 出典 - Hastie, T., Tibshirani, R., Friedman, J., *The Elements of Statistical Learning*, 2nd Edition, Springer, 2009, Chapter 6; Chapter 13, §13.3-§13.4.