# Neural Machine Translation by Jointly Learning to Align and Translate
> [!abstract] 概要
> [[Dzmitry Bahdanau]]、[[Kyunghyun Cho]]、[[Yoshua Bengio]] が、固定長ベクトルを介するRNNエンコーダー・デコーダーの長文ボトルネックを、微分可能な[[注意機構]]で解消した論文である。各目標語を生成するときに、原文の位置ごとの表現へ異なる重みを与えて文脈ベクトルを再計算する。WMT 2014英仏翻訳で固定長ベースラインを大幅に上回り、未知語を含まない文では句ベース翻訳システムMosesと同等以上のBLEUを報告した。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; [arXiv原典](https://arxiv.org/abs/1409.0473))
## ソース情報
- **30papers掲載名**: Neural Machine Translation by Jointly Learning to Align and Translate
- **30papers上の著者表記**: Bahdanau、Cho、Bengio
- **原典著者**: [[Dzmitry Bahdanau]]、[[Kyunghyun Cho]]、[[Yoshua Bengio]]
- **初回arXiv公開**: 2014-09-01
- **会議**: ICLR 2015口頭発表
- **確認版**: arXiv `1409.0473v7`、2016-05-19改訂
- **所属**: Jacobs University Bremen、Université de Montréal
- **30papers**: [掲載ページ](https://30papers.com/papers/neural-machine-translation/)
- **原典**: [arXiv 1409.0473](https://arxiv.org/abs/1409.0473)
30papersは本論文を「翻訳モデルが単一の固定要約だけでなく、関係する原文の語を振り返れるようにする注意機構を導入した論文」と位置づける。原典は2014年に初回公開され、2015年にICLR口頭発表として採択され、確認したPDFは2016年改訂のv7である。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]])
## 問題設定
初期のニューラル機械翻訳では、RNNエンコーダーが可変長の原文を一つの固定長ベクトル \(c\) へ圧縮し、RNNデコーダーがそこから訳文を生成した。原文が長くなるほど、翻訳に必要な全情報を一つのベクトルへ保持することが難しくなり、訓練時に見た文より長い文で性能が急落する。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§1–2)
本論文は、原文を位置ごとの表現列として残し、目標語ごとに必要な位置をソフトに探索する。これにより、全情報を単一ベクトルへ押し込まず、必要な情報を復号中に選択的に取り出せるようにする。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§1、§3)
## 提案手法
### 双方向RNNエンコーダー
順方向RNNと逆方向RNNを使い、原文位置 \(j\) ごとに両方向の隠れ状態を連結した注釈 \(h_j\) を作る。各注釈は原文全体の前後文脈を含みながら、位置 \(j\) 周辺へ強く焦点を当てる。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§3.2)
### ソフトアラインメント
目標位置 \(i\) の文脈ベクトルは、全原文注釈の重み付き和である。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§3.1)
\[
c_i=\sum_{j=1}^{T_x}\alpha_{ij}h_j
\]
重みは、直前のデコーダー状態 \(s_{i-1}\) と原文注釈 \(h_j\) の適合度をフィードフォワードネットワーク \(a\) で採点し、原文位置方向にソフトマックスで正規化する。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典式5–6)
\[
e_{ij}=a(s_{i-1},h_j),\qquad
\alpha_{ij}=
\frac{\exp(e_{ij})}{\sum_{k=1}^{T_x}\exp(e_{ik})}
\]
\(\alpha_{ij}\) は目標語 \(i\) が原文語 \(j\) に対応する確率として解釈でき、\(c_i\) は可能なアラインメント上の期待注釈になる。離散的な単語対応を潜在変数として探索せず、連続的な重みを直接計算するため、翻訳損失からアラインメントモデルを含む全構成要素へ誤差逆伝播できる。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§3.1)
![[_attachments/30papers-neural-machine-translation/fig01-model.png]]
図1。双方向RNNが位置ごとの注釈を作り、目標語 \(y_t\) を生成する時点の注意重み \(\alpha_{t,j}\) で集約してデコーダーへ渡す。固定文脈ではなく、生成位置ごとに文脈を変える構造である。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典図1)
## 実験設定
WMT 2014英仏翻訳を使う。Europarl、News Commentary、UN、二つのクロールコーパスを合わせた8億5000万語から、データ選択により3億4800万語へ削減した。news-test-2012と2013を開発集合、3003文のnews-test-2014を試験集合とする。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§4.1)
各言語の上位3万語だけを語彙に含め、それ以外を`[UNK]`へ写像する。固定長文脈のRNN Encoder–Decoderを`RNNencdec`、提案モデルを`RNNsearch`とし、それぞれ30語以下または50語以下の文で訓練した。隠れユニット1000、単語埋め込み620次元、ミニバッチ80、Adadelta付き確率的勾配降下法を使い、各モデルを約5日訓練した。復号にはビーム探索を使う。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§4、付録A–B)
## 実験結果
| モデル | BLEU・全試験文 | BLEU・未知語なし |
|---|---:|---:|
| RNNencdec-30 | 13.93 | 24.19 |
| RNNsearch-30 | 21.50 | 31.44 |
| RNNencdec-50 | 17.82 | 26.71 |
| RNNsearch-50 | 26.75 | 34.16 |
| RNNsearch-50・長時間訓練 | 28.45 | 36.15 |
| Moses | 33.30 | 35.63 |
RNNsearchは全比較で固定長RNNencdecを上回った。未知語のない文では、長時間訓練したRNNsearch-50がBLEU 36.15でMosesの35.63をわずかに上回る。一方、全試験文ではMosesが33.30、RNNsearchが28.45であり、3万語語彙による未知語処理が残るボトルネックだった。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典表1)
![[_attachments/30papers-neural-machine-translation/fig02-sentence-length.png]]
図2。固定長RNNencdecは文長20–30語以降にBLEUが急落するが、RNNsearch-50は50語を超えてもおよそ26–28を保つ。30語以下で訓練したRNNsearch-30も、50語以下で訓練したRNNencdec-50を上回るため、長文を訓練へ追加した効果だけでは説明できない。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典図2、表1)
## ソフトアラインメントの観察
英仏間の対応は概ね対角線上に現れるが、形容詞と名詞の語順が入れ替わる箇所では非単調な対応も学習した。`European Economic Area`を`zone économique européenne`へ訳す例では、`Area`から`zone`へ移り、その後`Economic`、`European`へ逆向きに注意を移した。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典§5.2.1)
![[_attachments/30papers-neural-machine-translation/fig03-soft-alignment.png]]
図3。四つの英仏翻訳における注意重み行列である。`the man`から`l’homme`への翻訳では、英語冠詞だけでなく後続名詞にも重みを分散させ、性・数に依存するフランス語冠詞を決める。ハードな一対一対応では扱いにくい多対多の関係を、ソフトな重みが自然に表す。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]; 原典図3、§5.2.1)
## 新規性
- 翻訳中の目標語ごとに、原文全位置へ異なる重みを割り当てる文脈依存の注意機構を導入した。
- アラインメントを離散潜在変数ではなく微分可能な期待値として表し、翻訳目的だけからエンドツーエンドで共同学習した。
- 固定長表現を位置ごとの記憶へ置き換え、長文で性能が落ちるという仮説を文長別BLEUで実証した。
- 注意重みを可視化し、単調な対応だけでなく語順変更や複数語依存を学習することを示した。
## 限界
- 実験はWMT 2014英仏翻訳だけであり、他言語対や他タスクへの一般性は未検証である。
- 3万語の短縮語彙により未知語を正しく生成できず、全試験文ではMosesに4.85 BLEU劣る。
- 各目標位置で全原文位置を採点するため、一文対あたり \(T_xT_y\) 回のアラインメント評価が必要になる。
- 図3の注意重みは直観的なアラインメントを示す定性的証拠であり、モデル判断の忠実な説明であることを検証していない。
- 本論文の注意は、RNNデコーダーがRNNエンコーダー出力を参照する交差注意である。Transformerが後に導入した系列内部の自己注意とは異なる。
- 各モデルは約5日の訓練で比較され、長時間訓練版だけが別に報告されるため、全モデルが同じ収束条件に達した比較ではない。
## 後続との接続
2017年の[[@2017__NeurIPS__Attention Is All You Need]]は、本論文型の加法的なエンコーダー・デコーダー注意を、内積注意・マルチヘッド化・自己注意へ発展させ、再帰自体を除いた[[Transformer]]を提案した。本論文が「単一固定ベクトルをやめ、必要な原文位置を選択的に読む」転換を行い、Transformerがその選択的読出しを系列計算の中心へ拡張したという系譜になる。(Source: [[.raw/articles/30papers-neural-machine-translation-2026-07-28]], [[@2017__NeurIPS__Attention Is All You Need]])
## 関連
- [[Dzmitry Bahdanau]]、[[Kyunghyun Cho]]、[[Yoshua Bengio]] — 著者
- [[注意機構]] — 目標位置ごとに原文表現を重み付き集約する中心手法
- [[RNN]]、[[LSTM]] — 本論文が拡張した系列モデル
- [[Transformer]] — 注意を再帰から独立させた後続アーキテクチャ
- [[@2017__NeurIPS__Attention Is All You Need]] — 後続のTransformer原論文
- [[@2026__30papers__Attention Is All You Need]] — 30papers版Transformer原論文
## 出典
- [[.raw/articles/30papers-neural-machine-translation-2026-07-28]]
- [30papers掲載ページ](https://30papers.com/papers/neural-machine-translation/)
- [arXiv原典](https://arxiv.org/abs/1409.0473)
- [ICLR 2015 conference PDF](https://arxiv.org/pdf/1409.0473)