# ImageNet Classification with Deep Convolutional Neural Networks > [!abstract] 概要 > 30papers が「ImageNet を大差で制し、現代の深層学習時代を始動させた畳み込みネットワーク」として選んだ AlexNet 論文の案内ページである。30papers 自体は著作権上の制約から論文本文を収載せず、NeurIPS の公式原典へ案内している。本ページでは30papersの選定理由を記録し、技術的主張と数値は公式PDFで照合した。(Source: [[.raw/articles/30papers-alexnet-2026-07-28]]; [30papers](https://30papers.com/papers/alexnet/); [公式PDF](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ![[_attachments/30papers-alexnet/fig01-paper-first-page.webp]] 30papers が代表画像として掲載する公式論文の第1ページ。著者3名、所属、要旨を確認できる。(Source: [30papers](https://30papers.com/papers/alexnet/)) ## ソース情報 - **30papers 掲載名**: ImageNet Classification with Deep Convolutional Neural Networks - **30papers 上の著者表記**: Krizhevsky, Sutskever, Hinton - **30papers 上の年**: 2012 - **30papers の位置づけ**: AlexNet。ImageNetを大差で制し、現代の深層学習時代を始動させた畳み込みネットワーク - **原典著者**: [[Alex Krizhevsky]]、[[Ilya Sutskever]]、[[Geoffrey Hinton]] - **原典掲載先**: Advances in Neural Information Processing Systems 25(NIPS 2012) - **所属**: [[University of Toronto]] - **公式原典**: [NeurIPS abstract page](https://papers.nips.cc/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html) - **公式PDF**: [Paper](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf) > [!contradiction] 公式HTML要旨と公式PDFの数値差 > NeurIPS の公式HTML要旨は訓練画像130万枚、top-1/top-5誤り率39.7%/18.9%、50万ニューロン、2つの大域接続層と記載する。一方、公式PDFの要旨と本文は訓練画像120万枚、37.5%/17.0%、65万ニューロン、3全結合層と記載する。本ページは実験表と整合する公式PDFの値を主記録とし、HTML要旨の差異を残す。(Source: [公式HTML要旨](https://papers.nips.cc/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html); [公式PDF](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ## 問題設定 自然画像では対象の姿勢・照明・背景・尺度が大きく変化するため、数万枚規模の従来データセットだけでは十分な一般化が難しかった。[[ImageNet]] は1500万枚超・約2万2000カテゴリのラベル付き画像を提供し、ILSVRCはそのうち1000カテゴリ、約120万枚の訓練画像を競技用に使った。著者らは、この規模のデータと画像の局所性を仮定する[[畳み込みニューラルネットワーク]]を、高速なGPU実装で結びつけた。(Source: [公式PDF §1–2](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) CNN は画素依存の局所性と統計的定常性を帰納的バイアスとして持つため、同規模の全結合ネットワークより接続数とパラメータ数が少ない。しかし当時は、高解像度画像へ大規模CNNを適用する計算費用が障壁だった。AlexNet はデータ規模、モデル容量、GPU計算、過学習抑制を一つの設計として扱い、この障壁を越えた。(Source: [公式PDF §1](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ## AlexNet の構成 [[AlexNet]] は重みを持つ8層、すなわち5つの畳み込み層と3つの全結合層からなる。最終層は1000クラスのsoftmaxであり、約6000万パラメータを持つ。入力は256×256へ整形した画像から224×224のパッチを切り出し、RGB画素ごとに訓練集合の平均を引く以外の前処理を行わない。(Source: [公式PDF §2, §3.5](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) 主要な構成は次のとおりである。(Source: [公式PDF §3](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) - **ReLU**: 飽和型のtanhより数倍速く学習し、CIFAR-10の4層CNNでは25%訓練誤り率へ到達するまでの反復数を6分の1にした。 - **2基のGPUへの分割**: GTX 580 1基の3GBメモリに収まらないモデルを2基へ分割し、通信する層を限定して計算量と通信量を調整した。 - **局所応答正規化**: 同じ空間位置にある隣接カーネル間で大きな活性を競合させ、top-1/top-5誤り率を1.4/1.2ポイント低減した。 - **重複プーリング**: 3×3領域をストライド2でプーリングし、非重複方式よりtop-1/top-5誤り率を0.4/0.3ポイント低減した。 2基のGPUは単なる高速化装置ではなく、層間接続の形そのものに影響した。第2・第4・第5畳み込み層は同じGPU上の前層特徴マップだけへ接続し、第3層と全結合層で両GPUの情報を統合する。モデル構造が当時のハードウェア制約を反映した例である。(Source: [公式PDF §3.2, §3.5](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ## 過学習の抑制 約6000万パラメータに対して120万枚の訓練画像でも過学習は大きな問題だった。著者らは、保存容量を増やさずCPU上で生成できる二種類のデータ拡張を採用した。第一は256×256画像からのランダムな224×224切り出しと水平反転であり、見かけ上の訓練集合を2048倍にする。第二はRGB画素分布の主成分方向へ色強度を摂動し、照明変化に対する不変性を近似する方法で、top-1誤り率を1ポイント超低減した。(Source: [公式PDF §4.1](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) 最初の2全結合層にはドロップアウトを適用し、学習時に各隠れニューロンの出力を確率0.5でゼロにした。入力ごとに異なる部分ネットワークを共有重みで学習するため、ニューロン間の過度な共適応を抑えられる。ドロップアウトなしでは顕著な過学習が生じた一方、採用すると収束までの反復数は概ね2倍になった。(Source: [公式PDF §4.2](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ## 学習 学習にはバッチサイズ128、モメンタム0.9、重み減衰0.0005の確率的勾配降下法を用いた。初期学習率は0.01で、検証誤り率が改善しなくなるたび10分の1へ下げ、合計3回減衰させた。120万枚の訓練集合を約90周し、2基の[[NVIDIA]] GTX 580 3GB GPUで5〜6日を要した。(Source: [公式PDF §5](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ## 結果 ILSVRC-2010では単一CNNがtop-1誤り率37.5%、top-5誤り率17.0%を達成した。従来のSIFTとFisher Vectorを用いる公開結果45.7%/25.7%から、それぞれ8.2/8.7ポイント改善した。(Source: [公式PDF §6, 表1](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ILSVRC-2012では、論文記載の単一CNNはtop-5検証誤り率18.2%、5モデルの平均は16.4%だった。ImageNet Fall 2011全体で事前学習した2モデルを加えた7モデルのアンサンブルはtop-5テスト誤り率15.3%を達成し、次点の26.2%を10.9ポイント下回った。30papers が「大差で制した」と述べる直接の根拠はこの差である。(Source: [[.raw/articles/30papers-alexnet-2026-07-28]]; [公式PDF §6, 表2](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) ## 解釈 論文の貢献は、ReLUやドロップアウトを個別に発明したことだけではない。大規模なラベル付きデータ、深いCNN、GPUに合わせた実装、データ拡張、正則化を一体化し、手設計特徴を使う従来法との大きな性能差として示した点にある。これは30papersの「現代の深層学習時代を始動させた」という歴史的評価と整合する。(Source: [[.raw/articles/30papers-alexnet-2026-07-28]]; [公式PDF §1–7](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)) 一方、論文自身は局所応答正規化やGPU分割接続など、後続モデルで必須ではなくなった要素も含む。したがってAlexNetの歴史的意味は、各構成要素が永続的な標準になったことより、「データ・計算・モデル容量・正則化の協調設計」が画像認識を大幅に前進させることを実証した点にある。(Source: [公式PDF §3–7](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf); [[@2026__30papers__CS231n Convolutional Neural Networks for Visual Recognition]]) ## 限界 - 30papers の個別ページは論文本文を収載せず、選定理由と公式原典へのリンクだけを提供する。 - ILSVRC-2012の15.3%は単一モデルではなく7モデルのアンサンブル結果であり、単一CNNの18.2%と区別する必要がある。 - 公式HTML要旨と公式PDFにはデータ件数・誤り率・ニューロン数・全結合層数の差異がある。 - GPUごとの分割接続や局所応答正規化は当時の計算資源と設計慣行に強く依存し、AlexNetの全要素が現代CNNの標準というわけではない。 ## 関連 - アーキテクチャ: [[AlexNet]]、[[畳み込みニューラルネットワーク]] - データセット: [[ImageNet]] - 著者: [[Alex Krizhevsky]]、[[Ilya Sutskever]]、[[Geoffrey Hinton]] - 所属・計算基盤: [[University of Toronto]]、[[NVIDIA]] - 教材上の位置づけ: [[@2026__30papers__CS231n Convolutional Neural Networks for Visual Recognition]] ## 出典 - [[.raw/articles/30papers-alexnet-2026-07-28]] - [30papers: ImageNet Classification with Deep Convolutional Neural Networks](https://30papers.com/papers/alexnet/) - [NeurIPS official abstract page](https://papers.nips.cc/paper/2012/hash/c399862d3b9d6b76c8436e924a68c45b-Abstract.html) - [NeurIPS official paper PDF](https://papers.nips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf)