# The Elements of Statistical Learning ## 概要 Stanford University の統計学者 3 名(Trevor Hastie・Robert Tibshirani・Jerome Friedman)が、統計学・データマイニング・機械学習という別々の用語体系で発展してきた予測手法群を、**共通の概念的枠組み**の下に整理した教科書である。数学よりも概念を強調し、豊富な図版と実データ例で手法を説明する方針を取る。線形回帰から始めて、正則化・基底展開・カーネル法・決定木・ブースティング・ニューラルネットワーク・SVM・教師なし学習・ランダムフォレスト・グラフィカルモデル・高次元問題(p ≫ N)までを一冊で扱う。 第 2 版ではグラフィカルモデル、ランダムフォレスト、アンサンブル手法、lasso の最小角回帰(LAR)・パスアルゴリズム、非負値行列因子分解、スペクトラルクラスタリング、そして「幅広い(wide)」データ(p が N より大きい場合)の多重検定と偽発見率を扱う章が追加された。 ## 書誌情報 - **書名**: The Elements of Statistical Learning: Data Mining, Inference, and Prediction, Second Edition - **著者**: Trevor Hastie, Robert Tibshirani, Jerome Friedman(いずれも Stanford University 統計学教授) - **出版社**: Springer(Springer Series in Statistics) - **出版年**: 2009(第 2 版。原本 PDF は増刷版で年ヒントは 2011) - **ISBN**: 978-0-387-84857-0 - **構成**: 全 18 章、本文 745 ページ(印字ノンブル p.1〜p.694 + 参考文献・索引) - **原本**: `.raw/books/elements-of-statistical-learning-2e/` ## 構成と主要テーマ 原書は部(Part)を設けず、全 18 章を一連の流れとして並べる。単純な手法から始めて漸進的に複雑な手法へ進む構成で、著者は第 1〜4 章と第 7 章を必読としている。以下は取り込んだ全 18 章。 **基礎(第 1〜2 章)** — 統計的学習問題の定義と、以降全章が参照する理論的な共通言語を据える。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 1 Introduction]] — 統計的学習問題を教師あり/教師なし学習に大別したうえで、スパムメール判定・前立腺がんデータ・手書き数字認識・DNA 発現マイクロアレイの 4 実例と本書全体の章構成を提示する導入章。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 2 Overview of Supervised Learning]] — 最小二乗法(低分散・高バイアス)と k 最近傍法(高分散・低分散)を両極として、統計的決定理論による最適予測子の導出・次元の呪い・学習の不良設定性・バイアス-バリアンストレードオフという枠組みを与える。 **線形手法と正則化(第 3〜6 章)** — 線形モデルを出発点に、基底展開と罰則によって複雑さを制御する道筋をたどる。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 3 Linear Methods for Regression]] — 部分集合選択(離散的)と縮小推定(連続的)という二軸、および制約領域の幾何が変数選択の有無を決めるという論点を軸に、ridge・lasso・elastic net・LAR・PCR・PLS を統一的に整理する。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 4 Linear Methods for Classification]] — 線形な決定境界を作る 4 つの経路(指示行列の線形回帰・LDA/QDA・ロジスティック回帰・分離超平面)を並べ、masking 問題と、同時分布 対 条件付き分布という推定原理の違いを対比する。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 5 Basis Expansions and Regularization]] — 入力を基底展開して線形手法をそのまま使い、複雑さを基底の個数ではなく罰則で制御する転換を示す。スプライン・平滑化スプライン・有効自由度・ウェーブレット・RKHS を扱う。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 6 Kernel Smoothing Methods]] — 局所回帰・カーネル密度推定・動径基底関数・混合モデルを「目標点の近傍にカーネルで重みを与えて単純なモデルを当てはめる」という一貫した発想で統一的に扱う。 **推論とモデル評価(第 7〜8 章)** — 当てはめた結果をどう評価し、どの枠組みで推論するかを扱う。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 7 Model Assessment and Selection]] — モデル選択とモデル評価という 2 つの異なる目的を区別し、訓練誤差の楽観性を実効パラメータ数で補正する解析的手法($C_p$・AIC・BIC・MDL・SRM)と標本再利用(交差検証・ブートストラップ)を体系的に提示する。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 8 Model Inference and Averaging]] — 当てはめの背後にある推論の枠組み(最尤推定・ベイズ推定・ブートストラップ)を統一的に示し、EM アルゴリズムとギブスサンプリングの構造的対応、バギング・スタッキング・バンプ狩りを扱う。 **木とアンサンブル(第 9〜10 章・第 15〜16 章)** — 決定木を基礎に、それを組み合わせる手法群へ進む。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 9 Additive Models, Trees, and Related Methods]] — GAM・決定木(CART)・PRIM・MARS・階層的専門家混合を扱い、以降の章が前提とする決定木の基礎(貪欲な育成・不純度指標・コスト複雑度による枝刈り・代理分割・不安定性)を据える。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 10 Boosting and Additive Trees]] — ブースティングを「前向き段階的加法モデリングによる損失関数最小化」へ再解釈し、AdaBoost と指数損失の等価性、勾配ブースティング(MART)、調整パラメータ、変数重要度と部分依存プロットを扱う。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 15 Random Forests]] — バギングされた木の分散を「木どうしの相関 $\rho$」という単一の量に帰着させ、分割候補変数のランダム化で $\rho$ を下げることで、分散削減に特化した非適応的なアンサンブルを実現する。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 16 Ensemble Learning]] — アンサンブル学習を「基底の辞書を生成する段階 + 辞書上で重みを当てはめる段階」の 2 段構えで統一し、ブースティングと lasso 正則化パスの近さ・bet on sparsity 原理・ISLE・Rule Ensembles を扱う総括章。 **非線形な判別と事例ベースの手法(第 11〜13 章)** → [[@2009__Springer__The Elements of Statistical Learning - Chapter 11 Neural Networks]] — ニューラルネットワークを射影追跡回帰の特殊ケースとして「導出特徴を学習する 2 段階モデル」と位置づけ、誤差逆伝播法・重み減衰・重み共有(畳み込み構造)・ベイズ的事後平均を扱う。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 12 Support Vector Machines and Flexible Discriminants]] — SVM を「ヒンジ損失 + L2 罰則」という正則化の枠組みに再解釈し、LDA を最適スコアリングによる線形回帰の系列として再定式化して FDA・PDA・MDA へ一般化する。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 13 Prototype Methods and Nearest-Neighbors]] — モデルを持たない分類手法として、訓練データを代表点で圧縮するプロトタイプ法(K-means・LVQ・ガウス混合)と、訓練データを保持する k 最近傍法(Cover-Hart 上界・不変計量・適応的計量 DANN)を対比する。 **教師なし学習とグラフ(第 14 章・第 17 章)** → [[@2009__Springer__The Elements of Statistical Learning - Chapter 14 Unsupervised Learning]] — 教師なし学習の代表手法(結合ルール・クラスタリング・SOM・主成分分析/主曲線・主曲面・スペクトラルクラスタリング・NMF・独立成分分析・多次元尺度構成法・PageRank)を共通の合成データで対比しながら概観する、本書最長の章。 → [[@2009__Springer__The Elements of Statistical Learning - Chapter 17 Undirected Graphical Models]] — 無向グラフでは辺の欠如が条件付き独立を意味することを出発点に、連続変数はガウス精度行列と graphical lasso で、離散変数はイジングモデル・RBM で、グラフ構造とパラメータを推定する。 **高次元問題(第 18 章)** → [[@2009__Springer__The Elements of Statistical Learning - Chapter 18 High-Dimensional Problems - p >> N]] — $p \gg N$ では分散が予測誤差を支配するため強い正則化を課す単純な手法が勝つことを示し、後半では多重検定において FWER に代わり偽発見率(FDR。Benjamini-Hochberg 法・SAM 法)を制御基準とすべきことを示す。 ## 影響と位置づけ 本書の特徴は、個々の手法を列挙するのではなく、**同じ論点を章をまたいで繰り返し再解釈する**ことにある。取り込みの過程で、以下のような章をまたぐ再解釈の連鎖が確認できた。 - **正則化の一般化**: 係数への罰則(第 3 章 ridge/lasso)→ 関数の滑らかさへの罰則(第 5 章 平滑化スプライン・RKHS)→ 損失関数の取り替え(第 12 章 SVM = ヒンジ損失 + L2 罰則)→ グラフ構造への罰則(第 17 章 graphical lasso)→ 高次元での正則化強度のスケーリング(第 18 章)。 - **アンサンブルの再解釈**: 決定木の不安定性(第 9 章)→ 損失関数最小化としてのブースティング(第 10 章)→ 木どうしの相関に帰着する分散削減(第 15 章)→ 「辞書の生成 + 事後の重み付け」という 2 段構え(第 16 章)。 - **次元の呪いの両義性**: 局所平均化を破綻させる障害としての次元(第 2 章・第 6 章)と、強い正則化で扱える設定としての高次元(第 18 章)は矛盾せず、**有効自由度が呪いの本体である**という統一像に整理できる。 なお第 11 章のニューラルネットワークの扱いは 2009 年時点のものであり、郵便番号データでの局所結合と重み共有(net-4/net-5)が現代の畳み込みニューラルネットワークの源流にあたる。 ## 関連 - 著者: [[Trevor Hastie]] / [[Robert Tibshirani]] / [[Jerome Friedman]] - 所属: [[Stanford University]] - 中心概念: [[統計的機械学習]] / [[縮小推定]] / [[バイアス-バリアンストレードオフ]] / [[次元の呪い]] / [[アンサンブル学習]] / [[決定木]] / [[カーネル法]] / [[交差検証]] ## 出典 - Hastie, T., Tibshirani, R., Friedman, J., *The Elements of Statistical Learning: Data Mining, Inference, and Prediction*, 2nd Edition, Springer, 2009.