# 統計モデリング: 二つの文化(Statistical Modeling: The Two Cultures)
> [!abstract] 概要
> データから結論を導くための統計モデリングの使い方には、二つの文化がある。一方は、データが与えられた確率的なデータモデルから生成されたと仮定する。もう一方は、アルゴリズムモデルを用い、データの生成機構は未知として扱う。統計学界は、ほぼ排他的にデータモデルを使うことに傾倒してきた。この傾倒は、無関係な理論と疑わしい結論を招き、統計家が多くの興味深い現代の問題に取り組むことを妨げてきた。アルゴリズムモデリングは、理論と実践の両面で統計学の外の分野で急速に発展した。それは大規模で複雑なデータ集合に使えるだけでなく、小さなデータ集合でもデータモデリングより正確で情報量の多い代替手段になりうる。分野の目標がデータを使って問題を解くことであるなら、データモデルへの排他的な依存から離れ、より多様な道具立てを採用する必要がある。
## 論文情報
- 著者: [[Leo Breiman]](カリフォルニア大学バークレー校統計学部)
- 掲載: Statistical Science, 16(3), 199-231, 2001(本体は 199-215 ページ。討論と回答が 216-231 ページ)
- 討論者: [[D. R. Cox]]、[[Bradley Efron]]、Bruce Hoadley、Emanuel Parzen。末尾に著者の回答(Rejoinder)が付く。
- arXiv 版なし。原本は `.raw/papers/` の PDF。
## 概要
統計学の主流であるデータモデリングの文化を、予測精度で評価するアルゴリズムモデリングの文化と対比し、統計学が前者に偏ることの害を論じた立場表明の論文である。三つの教訓(ラショーモン、オッカム、ベルマン)と三つの事例(肝炎、肝機能、マイクロアレイ)を軸に、目標は解釈可能性ではなく正確な情報だと主張する。本体は 17 ページ。討論では Cox が「戯画」だと批判し、Efron が偏りと理論の不足を指摘する。
## 問題設定
入力変数 x を入れると応答変数 y が出てくる黒い箱(ブラックボックス)として自然をとらえる。分析の目標は二つある。
- 予測: 将来の x に対する y を当てる。
- 情報: 自然が x と y をどう結び付けているかを抽出する。
これに対する二つの取り組みが、論文の主題である文化の違いを作る。
| 文化 | 箱の中身 | 代表的な道具 | 検証 | 見積もられた構成比 |
|---|---|---|---|---|
| データモデリング | 確率的なデータモデル(線形回帰、ロジスティック回帰、Cox モデル)を仮定し、パラメータを推定する | 適合度検定、残差の検討 | 可否の二値判定 | 統計家の 98% |
| アルゴリズムモデリング | 複雑で未知とみなし、x に作用して y を予測する関数 f(x) を探す | 決定木、ニューラルネットワーク | 予測精度 | 統計家の 2%(ほかは他分野) |
## 提案手法
新しい手法の提案ではなく、方針と道具立ての提示である。
**方針**(3 章のコンサルティング経験から)。良い解を見つけることに集中する。データと十分に付き合ってからモデル化する。モデルはアルゴリズムでもデータモデルでもよい。基準は検証データでの予測精度である。計算機は不可欠な相棒である。
**データモデルへの批判**(4 から 6 章)。
- 結論はモデルの機構についてのものであり、自然の機構についてのものではない。モデルが自然の粗い模倣なら結論は誤る。
- 適合度検定と残差分析は、次元が高いと検出力が低く、適合するモデルが多数あるのに、どれが良いかを決められない。
- 例として、教員給与の性差別を線形回帰の 5% 有意で「証明」した研究や、Cox モデルとロジスティック回帰が医学誌の事実上の標準になった状況を挙げる。
- 予測精度の見積もり(交差検証や検証用データ)は、この問題を避ける自然な尺度である。
**アルゴリズムモデリングの三つの教訓**(8 から 10 章)。
- ラショーモン: 同程度の最小誤差を与える良いモデルが多数ある。30 変数から 5 変数を選ぶ部分集合選択では約 14 万通りが競合し、RSS が最小の 1.0% 以内の式が多数あって、変数の重要度について異なる話をする。決定木は訓練データの 2 から 3% を除くだけで大きく変わり、小さなニューラルネットワークを 100 回学習し直すと 32 個の異なる極小に至った。この不安定性への対策として、モデルの集約(バギング)が挙げられる。
- オッカム: 単純さ(解釈可能性)と精度は予測において対立する。決定木は解釈可能性では A+ だが予測では B、[[ランダムフォレスト]]は予測で A+ だが解釈可能性では F である。結論は、まず予測精度を取り、その後に理由の理解を試みることである。
- ベルマン: 次元の呪いを避けて変数を減らす従来の助言に対し、逆に特徴量を増やす。形状認識フォレスト(Amit と Geman)とサポートベクターマシン(Vapnik)がその例である。
**ランダムフォレスト**は、ブートストラップ標本ごとに木を作り、各ノードで変数をランダムに選んで分割する。変数の重要度は、袋外の事例で変数の値を置換したときの誤分類率の増加で測る。
## 新規性
- 「二つの文化」という枠組みで、統計学の主流がデータモデルに偏っていることを、予測精度という単一の物差しから批判した。
- 精度と解釈可能性のジレンマを、「目標は解釈可能性ではなく正確な情報である」とする再定式化で解消しようとした。
- 複雑なモデル(ランダムフォレスト)が、単純なモデル(ロジスティック回帰)より信頼できる変数重要度と構造(クラスタ)の情報を与えうると、三つの実データで示した。
- 議論の性質は立場表明であり、新しい定理や網羅的な実験ではない。
## 実験設定
- 表1: 10 個のデータ集合(UCI 由来が中心)。上の 5 個は小規模(訓練データのみ)、下の 5 個は別のテスト用データを持つ大規模なものである。
- 小規模な 5 個は、データの 10% をランダムに除いて学習し、除いた分で誤差を測る作業を 100 回繰り返して平均した。
- 大規模な 5 個は、付属のテスト用データで評価した。
- 肝炎データ(155 人、19 変数、死亡 32、生存 123)は 10% を除く 100 回の平均で評価した。
- Bupa 肝機能データ(345 人、6 変数、2 クラス)とマイクロアレイのリンパ腫データ(81 標本、4,682 遺伝子、3 クラス)は、ランダムフォレストの出力を分析に使った。
**表1(Table 1) データ集合の説明**
| データ集合 | 訓練標本数 | テスト標本数 | 変数の数 | クラス数 |
|---|---|---|---|---|
| Cancer | 699 | なし | 9 | 2 |
| Ionosphere | 351 | なし | 34 | 2 |
| Diabetes | 768 | なし | 8 | 2 |
| Glass | 214 | なし | 9 | 6 |
| Soybean | 683 | なし | 35 | 19 |
| Letters | 15,000 | 5,000 | 16 | 26 |
| Satellite | 4,435 | 2,000 | 36 | 6 |
| Shuttle | 43,500 | 14,500 | 9 | 7 |
| DNA | 2,000 | 1,186 | 60 | 3 |
| Digit | 7,291 | 2,007 | 256 | 10 |
## 実験結果
**表2(Table 2) テスト誤分類率(%)**: ランダムフォレストは全データ集合で単一の決定木(CART)を上回った。
| データ集合 | フォレスト | 単一の木 |
|---|---|---|
| Breast cancer | 2.9 | 5.9 |
| Ionosphere | 5.5 | 11.2 |
| Diabetes | 24.2 | 25.3 |
| Glass | 22.0 | 30.4 |
| Soybean | 5.7 | 8.6 |
| Letters | 3.4 | 12.4 |
| Satellite | 8.6 | 14.8 |
| Shuttle ×10^3 | 7.0 | 62.0 |
| DNA | 3.9 | 6.2 |
| Digit | 6.2 | 17.1 |
- 誤差が半減するものもあれば、3 分の 1 減るものもある。Statlog の 18 分類器との比較(別テスト用データを持つ 4 個)では、フォレストの順位は 1, 1, 1, 1 で平均 1.0、次点の分類器は平均 7.3 だった。
- ZIP コードの手書き数字(Digit)では、手作業で作り込んだニューラルネットワークが 5.1%、標準的なフォレストが 6.2% であり、この点ではフォレストが劣る。
- 形状認識フォレストは NIST の手書き数字で誤差 0.7% を達成し、人間の限界に近い。サポートベクターマシンは、4 次の単項式まで特徴を足すと ZIP コードで分離可能になり誤差 4.1%、NIST の大規模部分集合で 1.1% だった。
**肝炎データ(11.1 節)**。
- ロジスティック回帰の誤差は 17.4%、ランダムフォレストは 12.3% で約 30% 低い。全員を生存と予測する基準線の誤差は 20.6% であり、ロジスティック回帰はこれをほとんど下回らない。
- ロジスティック回帰の標準化係数(図1)では変数 7 と 11 が重要に見え、この 2 変数だけで学習すると交差検証誤差が 22.9% に悪化する。
- ランダムフォレストの重要度(図2)は変数 12 と 17 を指す。それぞれ単独で 14.3% の誤差を出し、両方を使っても改善しない。この 2 変数は互いの代理であり、Diaconis と Efron のブートストラップで「4 変数のどれも 60% 超で選ばれなかった」理由を説明する。
![[_attachments/2001__Statistical-Science__Statistical-Modeling-The-Two-Cultures/fig01-standardized-coefficients-logistic.png]]
*図1(Figure 1) ロジスティック回帰の標準化係数(変数 7 と 11 が最大)*
![[_attachments/2001__Statistical-Science__Statistical-Modeling-The-Two-Cultures/fig02-variable-importance-random-forest.png]]
*図2(Figure 2) ランダムフォレストの変数重要度(変数 12 と 17 が約 42% の誤差増)*
- 変数 12 と 17 の値を、フォレストが出した階級 1 の確率に対して描くと、どちらもほぼ線形で似た形になる(図3)。相関が高い 2 変数の一方を落としても、ロジスティック回帰の結果はほとんど変わらなかった。
- ロジスティック回帰で同じ置換の重要度を測っても、12 と 17 は上位 3 変数に入らない。12 と 17 を単独で使うと、それぞれ誤差 15.7% と 19.3% だった。
![[_attachments/2001__Statistical-Science__Statistical-Modeling-The-Two-Cultures/fig03-variables-12-17-vs-probability.png]]
*図3(Figure 3) 変数 12(左)と変数 17(右)対 階級 1 の確率*
**Bupa 肝機能データ(11.2 節)**。フォレストの誤差は 28% である。重要度(図4)は血液検査 3 と 5、次に 4 が高い。フォレストが出す類似度でクラスタリングすると、重症クラス(クラス 2)の内部に二つの群が現れた(図5)。血液検査 3、4、5 が高い群と低い群である。
![[_attachments/2001__Statistical-Science__Statistical-Modeling-The-Two-Cultures/fig04-variable-importance-bupa.png]]
*図4(Figure 4) Bupa データの変数重要度*
![[_attachments/2001__Statistical-Science__Statistical-Modeling-The-Two-Cultures/fig05-cluster-averages-bupa.png]]
*図5(Figure 5) Bupa データのクラスタ平均(クラス 2 が二群に分かれる)*
**マイクロアレイ(11.3 節)**。4,682 遺伝子に変数選択なしでフォレストを適用し、誤差は低かった。全遺伝子の重要度(図6)は他のアルゴリズム的手法の評価と整合し、より鮮明に山が現れた。
![[_attachments/2001__Statistical-Science__Statistical-Modeling-The-Two-Cultures/fig06-microarray-variable-importance.png]]
*図6(Figure 6) マイクロアレイの変数重要度(遺伝子番号 700 付近と 3,600 付近に山)*
著者は、予測精度が高いほど基礎機構について信頼できる情報が得られ、精度が弱いと結論が疑わしくなると述べる。
## 考察
- 最終章(12 章)は、データモデルを全否定しない。「問題とデータに重点を置く」ことを求め、最良の解は、アルゴリズムモデル、データモデル、あるいはその組み合わせでありうるとする。
- 統計学は新しい大規模データ(天文、遺伝子)に取り組む機会を、データモデルへの固執のために失っているとする。
**討論(216-231 ページ、要点のみ)**
- **Cox**: 主流の統計思考の「戯画」であり、示唆に富むがすべての応用に一般化できない。出発点はデータではなく問いや科学的仮説にあり、欠測、測定誤差、生成過程は確率モデル抜きでは扱いにくい。直接の経験的予測が優れる場面(短期の経済予測、洪水予報)を認めつつ、データと異なる条件への予測では機構の理解が要ると述べる。「正確な答えを間違った問いに出すより、粗い答えを正しい問いに」という格言も引く。Vapnik の完全分離の定理は、ブートストラップや交差検証が安定性の錯覚を与えうると留保する。
- **Efron**: 20 世紀は「不偏性の 100 年」であり、新しいアルゴリズムの成功はどこかで偏りのある推定に依存するはずだが、その理論が乏しいとする。二つの規則(新しい手法は常に古い手法より良く見える、複雑な手法は批判しにくい)を挙げ、この論文は「理論を減らせ」ではなく「理論を増やせ」の呼びかけだと読む。予測文化は Stanford の周辺では 2% よりずっと大きいとも述べる。
- **Hoadley**: 信用スコアリング(Fair, Isaac)での経験から、結論に賛同する。スコアカードは一般化加法モデル(GAM)にあたり、GAM を葉に持つ中規模の木のように、オッカムのジレンマを避ける実務を挙げる。
- **Parzen**: 予測と情報の二目標を、短期の利益を求める「経営」と長期の真理を求める「科学」に言い換える。分位関数と比較密度に基づく「分位の文化」を、両文化を統合する第三の枠組みとして提案する。
- **回答(Rejoinder)**: 統計家はもっと実用的になるべきだと述べる。主流の定義は SAS や SPSS の利用者数で数えれば著者の側が 100 対 1 で優勢だとし、Efron の「つまみの多いブラックボックス」との批判には、ランダムフォレストの調整は事実上 1 個、サポートベクターマシンは 1 から 2 個だと答える。変数重要度は現時点で満足な理論的定義がなく、研究課題だと認める。
## 強み / 弱点・課題
**強み**
- 予測精度を、データモデルの適合度の代わりに検証の中心に据えるという簡潔な基準が、その後の機械学習の評価慣行に一致する。
- 肝炎の事例で、モデルの基準線(全員を生存と予測)を示し、精度の低いモデルが示す重要度の信頼性を疑う、という検証の型を具体的に示した。
- ラショーモン効果を、モデル選択の不安定性と結び付けて整理した。
**弱点・課題**
- 主流統計の描写が、著者自身の回答が認めるように「定義の問題」を含み、Cox が指摘する戯画性を免れない。
- 解釈と因果の問題(データと異なる条件への予測)は扱わない。Cox と Efron が指摘する点である。
- ランダムフォレストの優位は、当時のデータ集合と比較対象に依存する。Efron の言う「新しい手法が常に良く見える」問題は、論文自身にも当てはまりうる。
- 変数重要度の理論的な定義がなく、相関する変数の扱いは 12 と 17 の例による示唆にとどまる。
## 関連
- 概念: [[ランダムフォレスト]] / [[変数重要度]] / [[統計的機械学習]] / [[予測モデルの解釈手法]] / [[アンサンブル学習]] / [[次元の呪い]] / [[サポートベクターマシン]]
- 人物: [[Leo Breiman]] / [[D. R. Cox]] / [[Bradley Efron]] / [[Jerome Friedman]]
- ソース: [[@2026__応用物理__機械学習の原点 - 統計的機械学習の世界]]
## 出典
- `.raw/papers/2001__Statistical-Science__Statistical-Modeling-The-Two-Cultures.pdf`