# 注意機構 ## 定義 **注意機構**は、クエリまたは現在の状態に対する各入力表現の適合度を計算し、正規化した重みで入力を選択的に集約する機構である。[[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]]では、目標語 \(i\) の直前のデコーダー状態 \(s_{i-1}\) をクエリ、原文位置 \(j\) の双方向RNN注釈 \(h_j\) を参照対象として、次の加法的注意を使う。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]]) \[ e_{ij}=v_a^\top\tanh(W_as_{i-1}+U_ah_j),\qquad \alpha_{ij}= \frac{\exp(e_{ij})}{\sum_k\exp(e_{ik})},\qquad c_i=\sum_j\alpha_{ij}h_j \] 重み \(\alpha_{ij}\) は、目標語 \(i\) を生成するときに原文位置 \(j\) をどの程度参照するかを表す。文脈ベクトル \(c_i\) は生成位置ごとに変わるため、原文全体を一つの固定長ベクトルへ圧縮する必要がない。離散的な選択ではなく全位置の重み付き和なので微分可能であり、翻訳目的からエンコーダー、アラインメント、デコーダーを共同学習できる。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]]) ## 主要な形態 ### エンコーダー・デコーダー注意 クエリはデコーダー状態、キーとバリューに相当する表現はエンコーダー出力から来る。Bahdanauらの論文では、双方向RNNが作る原文注釈をRNNデコーダーが目標語ごとに読む。後のTransformerでは、デコーダーがエンコーダー出力を参照するマルチヘッド注意として残る。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]], [[@2017__NeurIPS__Attention Is All You Need]]) ### 自己注意 クエリ、キー、バリューが同じ系列表現から作られ、系列内部の位置同士を直接結ぶ。Transformerは自己注意をエンコーダーとデコーダーの中心演算に使い、再帰と畳み込みを除いた。Bahdanau型注意がRNN間の選択的な読出し機構だったのに対し、自己注意は系列表現を更新する基本層である。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]], [[@2017__NeurIPS__Attention Is All You Need]]) ### 加法的注意と内積注意 Bahdanau型はクエリとキーをフィードフォワードネットワークで採点する加法的注意である。Transformerは \(\mathrm{softmax}(QK^\top/\sqrt{d_k})V\) というスケール付き内積注意を使い、行列積による効率的な並列計算とマルチヘッド化を行う。両者とも適合度、ソフトマックス、バリューの重み付き和という構造を共有する。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]], [[@2017__NeurIPS__Attention Is All You Need]]) ## 性質 - **動的な情報選択**: 出力位置やクエリごとに参照する入力位置を変えられる。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]]) - **固定長ボトルネックの回避**: 情報を位置ごとの表現へ分散して保持し、必要な部分を復号時に取り出す。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]]) - **微分可能なソフト選択**: 全位置の重み付き和により、離散アラインメント教師なしで誤差逆伝播できる。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]]) - **語順変更への対応**: 単調制約を置かず、翻訳時の非単調な位置対応を学習できる。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]]) - **全対計算**: Bahdanau型翻訳では \(T_xT_y\)、自己注意では同長系列に対して \(O(n^2)\) の位置対を評価する。柔軟な大域参照と計算量が表裏一体になる。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]], [[@2017__NeurIPS__Attention Is All You Need]]) ## 横断的知見 - Bahdanauらの2014年論文は、注意を「固定長のRNN記憶から情報を救い出す外部読出し」として導入した。Transformer原論文は2017年に、その読出し操作を自己注意へ拡張し、RNNの状態遷移そのものを置き換えた。両ソースを並べると、注意機構の歴史的役割は、補助的なアラインメントから系列モデルの主計算へ移ったことが分かる。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]], [[@2017__NeurIPS__Attention Is All You Need]]) - Bahdanau型注意は、目標語ごとに全原文位置を参照することで長文に強くなったが、一文対あたり \(T_xT_y\) 回の採点を必要とする。Transformerの自己注意も任意位置間を直接結ぶ一方で \(O(n^2)\) の計算量を持つ。柔軟な大域アクセスが長距離依存のパスを短くする代わりに、位置対の計算量を増やすという設計交換は両世代に共通し、[[線形注意]]やスパース注意の研究課題へ続く。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]], [[@2017__NeurIPS__Attention Is All You Need]]) - [[@2026__30papers__The Unreasonable Effectiveness of Recurrent Neural Networks]]は2015年時点で、RNNを中心アーキテクチャとしながら注意機構を特に有望な革新と評価した。2017年のTransformerは注意だけで再帰を除き、同記事が「RNNの追加機構」と見ていた要素を独立した基盤へ転換した。この二年間は、系列モデルの主役が状態圧縮から選択的な記憶アクセスへ移った転換期と読める。(Source: [[@2026__30papers__The Unreasonable Effectiveness of Recurrent Neural Networks]], [[@2017__NeurIPS__Attention Is All You Need]]) - Bahdanau型のソフトアラインメントは、英仏翻訳の対角線、語順変更、冠詞と名詞の複数語依存を可視化した。Transformerもヘッドごとの注意パターンを構文や照応の観察に使った。両者は内部の重みを検査可能にしたが、どちらの原論文も「重みがモデル判断の因果的で完全な説明である」とは検証していない。可視化可能性と説明の忠実性は区別する必要がある。(Source: [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]], [[@2017__NeurIPS__Attention Is All You Need]]) ## 未解決の問い - 注意重みは、入力位置の因果的寄与をどの条件で忠実に表すか。重みの可視化と介入実験による寄与評価をどう対応づけるか。 - 加法的注意、内積注意、カーネル化注意の選択は、精度、計算効率、長さ外挿にどのような体系的差を生むか。 - 全対注意の長距離アクセスを保ちながら、\(O(n^2)\) の計算量とメモリをどこまで減らせるか。 - ソフト注意が複数候補へ確率質量を分散する利点と、ハード注意による疎な計算の利点を、同一の学習目的でどう両立するか。 - 翻訳で得られた「固定長表現より位置別記憶を選択的に読む」という原理は、音声、画像、動画、外部メモリでどの表現単位をキーとバリューにすべきか。 - 多数のアテンションヘッドが同じ機能へ重複する場合、性能を落とさずに役割分化や疎性を促すには何が必要か。 ## 関連 - [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]] — 加法的なエンコーダー・デコーダー注意の中心ソース - [[Dzmitry Bahdanau]]、[[Kyunghyun Cho]]、[[Yoshua Bengio]] — 著者 - [[@2017__NeurIPS__Attention Is All You Need]] — 自己注意とTransformerへの発展 - [[@2026__30papers__Attention Is All You Need]] — 30papers版Transformer原論文 - [[@2026__30papers__The Unreasonable Effectiveness of Recurrent Neural Networks]] — 2015年時点のRNNと注意の位置づけ - [[RNN]]、[[LSTM]] — Bahdanau型注意の基盤 - [[Transformer]] — 注意を主計算へ拡張したアーキテクチャ - [[線形注意]] — 全対注意の計算量を削減する系譜 - [[アテンションヘッド]] — マルチヘッド注意の機能分化 ## 出典 - [[@2026__30papers__Neural Machine Translation by Jointly Learning to Align and Translate]] - [[@2017__NeurIPS__Attention Is All You Need]] - [[@2026__30papers__Attention Is All You Need]] - [[@2026__30papers__The Unreasonable Effectiveness of Recurrent Neural Networks]]