## 定義
**変分ベイズニューラルネットワーク**は、ニューラルネットワークの重みを単一の点推定値ではなく確率変数として扱い、計算しやすい分布族 \(Q(\mathbf w)\) で重みの事後分布を近似する手法である。典型的には
\[
\mathcal L(Q)
=
\mathbb E_{Q(\mathbf w)}[-\log p(D\mid\mathbf w)]
+D_{\mathrm{KL}}(Q(\mathbf w)\Vert P(\mathbf w))
\]
を最小化する。第1項は重みの不確実性を平均したデータ不適合、第2項は近似事後分布が事前分布から得た情報量である。点推定の重みだけでなく、重みごとの平均と分散を学習する。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]])
1993年のHintonとvan Campの論文は「変分ベイズニューラルネットワーク」という名称を使わないが、独立ガウスの重み分布を訓練中に最適化し、期待誤差と \(D_{\mathrm{KL}}(Q\Vert P)\) を交換する構成を示した。この意味で、後の変分ベイズ型ニューラルネットワークに先行する。ただし同論文の \(P\) は符号化のためデータから学習され、その伝達コストを無視するため、通常の固定事前分布を使う完全なベイズ推論と同一ではない。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]])
## 重みの精度を学ぶ
重み \(w_i\) ごとに \(Q_i=\mathcal N(\mu_i,\sigma_i^2)\) を置くと、\(\mu_i\) は代表的な重み値、\(\sigma_i\) はその重みをどれほど粗く指定できるかを表す。大きい \(\sigma_i\) は重みの情報量を減らすが、予測の分散を増やす。学習は、予測へ敏感な重みを高精度に、影響の小さい重みを低精度にする。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]])
固定分散のゼロ平均ガウス事前分布と、すべての重みを同じ精度で送る仮定まで固定すると、複雑度項は重み二乗和に対応する。通常のweight decayは、重みごとの不確実性を学習しない制限された場合として位置づけられる。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]])
## 符号長としての解釈
bits-back符号化では、送信者が \(Q\) から重みを標本化するために使った乱数ビットを、受信者が \(Q\) を再構成して回収する。事前分布 \(P\) で標本を送るコストから回収ビットを引くと、正味の期待重み符号長は \(D_{\mathrm{KL}}(Q\Vert P)\) になる。したがって変分目的は、データを説明する符号長と重みを伝える符号長の和として読める。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]])
この解釈は、モデル圧縮と予測不確実性を同じ分布パラメータへ結びつける。ただし短い符号が良い予測を必ず選ぶわけではない。Hintonとvan Campの予備実験では、最小の総記述長を得た解が平均予測へ退化し、テスト相対誤差は約1.0だった。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]])
## 横断的知見
- [[最小記述長原理]]との関係では、重み分布のKL項はモデル記述長の計算可能な代理になる。一方、データから学習した事前分布のパラメータを送るコストを除外すると、モデル記述を過小評価する。refined MDLが符号選択やparametric complexityを明示する理由が、初期のニューラルMDL実装の失敗から具体的に見える。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]], [[@2026__30papers__A Tutorial Introduction to the Minimum Description Length Principle]])
- [[変分損失性オートエンコーダ]]もbits-backによってKL項を符号長として読むが、確率化する対象が異なる。Hintonとvan Campはデータ集合全体で共有する**重み**の事後分布 \(Q(\mathbf w)\) を符号化し、VAEは各観測に対応する**潜在変数**の近似事後分布 \(q(\mathbf z\mid\mathbf x)\) を符号化する。前者はモデルの複雑度、後者はデータ表現の情報配置を主に制御する。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]], [[@2026__30papers__Variational Lossy Autoencoder]])
- ガウス混合事前分布が重みクラスタを表現すると、KLは単なる重みの小ささではなく、共有できる値のパターンを評価する。したがって「単純なネットワーク」は、重みが一様に小さいネットワークではなく、必要な精度が低く、共通の符号分布で短く表せるネットワークである。(Source: [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]])
## 未解決の問い
- 重み間の相関を捨てる平均場近似は、予測不確実性と圧縮率をどの程度歪めるか。
- 学習した事前分布、ハイパーパラメータ、アーキテクチャまで含む総符号長を、実用的な計算量でどう評価するか。
- 変分目的の大域最小値が予測の退化解になる条件を、最適化失敗と符号設計の不備へどう分解するか。
- 深い非線形ネットワークで期待尤度を推定する際、勾配分散を抑えながら大きな重み不確実性を扱うにはどうするか。
- 重みの短い記述と、未知分布への汎化、校正された予測不確実性、実際の圧縮ファイルサイズはどの条件で一致するか。
## 関連
- [[最小記述長原理]] — 重みのKLをモデル符号長として解釈する原理
- [[変分損失性オートエンコーダ]] — 潜在変数にbits-back符号化を適用する別の変分モデル
- [[Geoffrey Hinton]] — 重みの記述長を最小化する初期研究の共著者
## 出典
- [[@2026__30papers__Keeping Neural Networks Simple by Minimizing the Description Length of the Weights]]
- [[@2026__30papers__Variational Lossy Autoencoder]]
- [[@2026__30papers__A Tutorial Introduction to the Minimum Description Length Principle]]