## 概要 Noam Shazeer は [[Google Brain]] に在籍した研究者であり、深層学習の2つの基礎的アーキテクチャを共著した。[[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]] の筆頭著者として、スパースゲート型 [[Mixture-of-Experts]] 層を提案し、条件付き計算の約束を初めて大規模に実証した。また [[@2017__NeurIPS__Attention Is All You Need]] の共著者として、Scaled Dot-Product Attention・Multi-Head Attention を設計した。 ## 経歴 - **[[Google Brain]]**: スパースゲート型 MoE(ICLR 2017)を筆頭著者として発表。Transformer アーキテクチャ(NeurIPS 2017)の共著者。 - **Character.AI**: Google 退職後に Noam Shazeer と Daniel De Freitas が創業した会話型 AI 企業。 ## 主な貢献 - **[[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]]**: スパースゲート型 MoE 層を提案。Noisy Top-K ゲーティング・負荷分散補助損失($L_{\mathrm{importance}}$・$L_{\mathrm{load}}$)・データ並列 × モデル並列の混合という 3 つの技術革新を組み合わせ、計算コストをほぼ増やさずにモデル容量を 1000 倍以上拡大した。この論文が Switch Transformer・GShard・DeepSeek-MoE 等の MoE ベース LLM すべての理論的起点となる。 - **[[@2017__NeurIPS__Attention Is All You Need]]**: Scaled Dot-Product Attention($1/\sqrt{d_k}$ スケーリング)・Multi-Head Attention・パラメータフリー位置表現を提案。研究のほぼ全詳細に関与。 ## 関連 - [[Google Brain]] - [[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]] - [[@2017__NeurIPS__Attention Is All You Need]] - [[Transformer]] - [[Mixture-of-Experts]] - [[条件付き計算]] - [[スパースゲーティング]] ## 出典 - [[@2017__ICLR__Outrageously Large Neural Networks The Sparsely-Gated Mixture-of-Experts Layer]](筆頭著者) - [[@2017__NeurIPS__Attention Is All You Need]](共著者)