# Mathematics for Machine Learning
## 概要
機械学習を支える数学的基礎を、機械学習の側から必要とされる範囲に絞って体系的に積み上げる教科書である。第 I 部(1〜7 章)で線形代数・解析幾何・行列分解・ベクトル解析・確率と分布・連続最適化を扱い、第 II 部(8〜12 章)でそれらを土台に線形回帰・主成分分析による次元削減・混合ガウスモデルによる密度推定・サポートベクターマシンによる分類という 4 つの中心問題を導出する。Foreword は、機械学習の教科書が数学の素養を前提にしてしまう一方で、数学の教科書は機械学習の文脈を持たないという断絶を埋めることを本書の目的として述べている。(Source: Foreword)
## 書誌情報
- **著者**: Marc Peter Deisenroth, A. Aldo Faisal, Cheng Soon Ong
- **出版社**: Cambridge University Press
- **出版年**: 2020(本 PDF は 2021-07-29 付けの無償公開ドラフト版)
- **構成**: Foreword + 全 12 章(第 I 部: 数学的基礎 1〜7 章 / 第 II 部: 機械学習の中心問題 8〜12 章)、417 ページ(PDF)
- **URL**: https://mml-book.com
- **原本**: `.raw/books/mathematics-for-machine-learning/`
## 構成と主要テーマ
### 導入(第 1 章)
機械学習を「データ・モデル・学習」の 3 概念に分解し、本書の二部構成と 2 通りの読み方(基礎から積み上げる bottom-up と、応用から必要な数学へ降りる top-down)を提示する。
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 1 Introduction and Motivation]] — 機械学習の 3 要素を導入し、本書の二部構成と読み方を提示する序章
### 第 I 部: 数学的基礎(第 2〜7 章)
機械学習の手法を導出するのに必要な数学を、線形代数から連続最適化まで一続きの体系として積み上げる。各章は次章の前提になっており、第 II 部の 4 つの問題はここで用意した道具だけで解かれる。
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 2 Linear Algebra]] — 連立方程式・ベクトル空間・線形独立・基底とランク・線形写像・アフィン空間を積み上げる線形代数の基盤章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 3 Analytic Geometry]] — 内積を導入し、代数的なベクトル空間に長さ・角度・直交射影という幾何を与える章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 4 Matrix Decompositions]] — 行列式と固有値で行列を要約し、Cholesky 分解・固有値分解・特異値分解で分解して低ランク近似へ至る章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 5 Vector Calculus]] — 微分・勾配・ヤコビ行列・ヘッセ行列・テイラー級数を、誤差逆伝播と自動微分の計算基盤として整備する章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 6 Probability and Distributions]] — 確率空間・和と積の規則・ベイズの定理・要約統計量・ガウス分布の閉性・共役性と指数型分布族を体系化する章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 7 Continuous Optimization]] — 勾配降下法と凸最適化(ラグランジュ双対・線形計画/二次計画・凸共役)という 2 つの道具立てで第 I 部を締めくくる章
### 第 II 部: 機械学習の中心問題(第 8〜12 章)
第 8 章が総論として枠組みを与え、第 9〜12 章が回帰・次元削減・密度推定・分類という 4 つの問題を、第 I 部の数学だけで導出する。
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 8 When Models Meet Data]] — モデルを関数と見る見方と確率分布と見る見方を並べ、経験リスク最小化・最尤推定・ベイズ推論・グラフィカルモデル・モデル選択を統合する第 II 部の総論
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 9 Linear Regression]] — 最尤推定・過学習・MAP 推定(正則化)・ベイズ線形回帰を経て、回帰を直交射影として幾何的に統一する章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 10 Dimensionality Reduction with Principal Component Analysis]] — 主成分分析を分散最大化・射影誤差最小化・確率的潜在変数モデルの 3 観点から導出し、同一の固有値問題に帰着させる章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 11 Density Estimation with Gaussian Mixture Models]] — 混合ガウスモデルの最尤推定が閉形式で解けないことから EM アルゴリズムを導き、潜在変数の観点で下界最大化として再解釈する章
→ [[@2020__Cambridge__Mathematics for Machine Learning - Chapter 12 Classification with Support Vector Machines]] — マージン最大化とヒンジ損失+正則化という 2 つの見方を統一し、双対形の内積構造からカーネル法へ橋渡しする章
## 影響と位置づけ
本書の設計上の特徴は、**同じ対象を複数の独立した観点から導出し、それらが同一の解に到達することを見せる**構成にある。主成分分析は分散最大化・射影誤差最小化・確率的潜在変数モデルの 3 観点から(第 10 章)、サポートベクターマシンは幾何的マージン最大化とヒンジ損失+正則化の 2 観点から(第 12 章)、混合ガウスモデルの責任度は天下り的な導入とベイズの定理からの導出の 2 経路から(第 11 章)導かれる。手法をアルゴリズムの手順として覚えるのではなく、なぜその形になるのかを数学から再構成できるようにすることが目的になっている。
既存の [[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]] が統計的な応用と手法比較を主軸に置くのに対し、本書はその**数学的基礎の側**を担う。同じ手法(主成分分析・サポートベクターマシン・カーネル法・EM アルゴリズム)を両者が扱う場合、前者が結果を所与として使うのに対し、本書は第一原理から導出する、という非対称な補完関係にある。
## 関連
- 著者: [[Marc Peter Deisenroth]] / [[A. Aldo Faisal]] / [[Cheng Soon Ong]]
- 第 I 部が育てた概念: [[線形写像と変換行列]] / [[直交射影]] / [[固有値分解]] / [[特異値分解]] / [[自動微分]] / [[ガウス分布の閉性]] / [[共役事前分布]] / [[凸最適化]]
- 第 II 部が育てた概念: [[経験リスク最小化]] / [[有向グラフィカルモデル]] / [[ベイズ線形回帰]] / [[主成分分析]] / [[混合ガウスモデル]] / [[EMアルゴリズム]] / [[サポートベクターマシン]] / [[カーネル法]]
- 関連書籍: [[wiki/entities/The Elements of Statistical Learning|The Elements of Statistical Learning]]
## 出典
- Marc Peter Deisenroth, A. Aldo Faisal, Cheng Soon Ong, *Mathematics for Machine Learning*, Cambridge University Press, 2020.