## 概要
Noam Shazeer は [[Google Brain]] に在籍した研究者であり、深層学習の2つの基礎的アーキテクチャを共著した。[[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]] の筆頭著者として、スパースゲート型 [[Mixture-of-Experts]] 層を提案し、条件付き計算の約束を初めて大規模に実証した。また [[@2017__NeurIPS__Attention Is All You Need]] の共著者として、Scaled Dot-Product Attention・Multi-Head Attention を設計した。
## 経歴
- **[[Google Brain]]**: スパースゲート型 MoE(ICLR 2017)を筆頭著者として発表。Transformer アーキテクチャ(NeurIPS 2017)の共著者。
- **Character.AI**: Google 退職後に Noam Shazeer と Daniel De Freitas が創業した会話型 AI 企業。
## 主な貢献
- **[[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]]**: スパースゲート型 MoE 層を提案。Noisy Top-K ゲーティング・負荷分散補助損失($L_{\mathrm{importance}}$・$L_{\mathrm{load}}$)・データ並列 × モデル並列の混合という 3 つの技術革新を組み合わせ、計算コストをほぼ増やさずにモデル容量を 1000 倍以上拡大した。この論文が Switch Transformer・GShard・DeepSeek-MoE 等の MoE ベース LLM すべての理論的起点となる。
- **[[@2017__NeurIPS__Attention Is All You Need]]**: Scaled Dot-Product Attention($1/\sqrt{d_k}$ スケーリング)・Multi-Head Attention・パラメータフリー位置表現を提案。研究のほぼ全詳細に関与。
## 関連
- [[Google Brain]]
- [[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]]
- [[@2017__NeurIPS__Attention Is All You Need]]
- [[Transformer]]
- [[Mixture-of-Experts]]
- [[条件付き計算]]
- [[スパースゲーティング]]
## 出典
- [[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]](筆頭著者)
- [[@2017__NeurIPS__Attention Is All You Need]](共著者)