G検定 用語解説
Self-Attentionとは
同じ系列内の要素どうしを互いに関連づけて重み付けする、Attention(注意機構)の一種。Transformerのエンコーダ・デコーダ内部で使われ、離れた位置の要素間の関係も並列に捉えられる。
まず押さえる結論
Self-Attentionは、G検定の「大項目5 ディープラーニングの要素技術」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。
情報源と編集区分
公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-07-03。
試験概要(公式)試験での問われ方
定義の言い換え
用語そのものではなく、説明文の一部を言い換えて出されることがあります。
似た概念との比較
同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。
具体例からの判断
問題文の事例が、定義のどの部分に対応しているかを先に確認します。
誤答しやすいポイント
×CNN(画像・畳み込み/プーリング)とRNN(時系列・系列データ)の使い分け。
×LSTMとGRUのゲート数の混同(LSTM=3ゲート+記憶セル、GRU=2ゲートに簡略化)。
×最適化手法の取り違え(モメンタム=慣性、AdaGrad/RMSProp=適応学習率、Adam=両方)。GAN・VAE・拡散モデルの生成方式の違い。
関連する確認問題
大項目5 ディープラーニングの要素技術 / 生成モデルと注意機構
再帰や畳み込みの構造を用いず、系列内の各要素が互いにどれだけ関連するかを表す重みを計算する注意の仕組みを全面的に採用した、系列データを扱う多くのタスクで主流となったモデルはどれか。
正解は「Transformer」である。Transformerは再帰や畳み込みの構造を用いず、系列内の各要素が互いにどれだけ関連するかを表す自己注意(Self-Attention)を計算して情報を重み付けし、系列データを扱う多くのタスクで主流となったモデルである。LSTM・GRU・双方向RNNはいずれも再帰構造を基礎とする手法であり、注意機構を全面的に採用したモデルではない。設問は「再帰や畳み込みを用いず注意機構を全面採用」という構造を問うており、これに該当するのはTransformerだけである。
大項目5 ディープラーニングの要素技術 / 生成モデルと注意機構
Transformerで用いられる自己注意(Self-Attention)機構が行うことの説明として、最も適切なものはどれか。
正解は「系列内の各要素が、同じ系列内の他の要素とどれだけ関連するかを計算し、文脈に応じた表現を作る」である。自己注意(Self-Attention)は、系列内の各要素が同じ系列内の他の要素とどれだけ関連するか(注意の重み)を計算し、文脈に応じた表現を作る仕組みである。畳み込みはCNN、1つずつ順番に処理して状態を渡すのはRNN、ランダムに間引くのはドロップアウトの説明であり、いずれも自己注意とは異なる。処理の違いを、画像の局所処理、時系列の逐次処理、過学習対策、系列内の関連計算に分ける。Transformerの自己注意に対応するのは、同じ系列の要素同士を比較して文脈を作る処理である。
大項目5 ディープラーニングの要素技術 / 生成モデルと注意機構
文中の各単語が同じ文の他の単語をどの程度参照すべきか計算し、文脈を反映した表現を作る機構はどれか。
この事例では「同一系列内の要素同士の関連度を計算するか」を確認すると、系列内の各要素が、同じ系列内の他の要素とどれだけ関連するかを計算し、文脈に応じた表現を作るに絞れる。正解は「系列内の各要素が、同じ系列内の他の要素とどれだけ関連するかを計算し、文脈に応じた表現を作る」である。自己注意(Self-Attention)は、系列内の各要素が同じ系列内の他の要素とどれだけ関連するか(注意の重み)を計算し、文脈に応じた表現を作る仕組みである。畳み込みはCNN、1つずつ順番に処理して状態を渡すのはRNN、ランダムに間引くのはドロップアウトの説明であり、いずれも自己注意とは異なる。処理の違いを、画像の局所処理、時系列の逐次処理、過学習対策、系列内の関連計算に分ける。Transformerの自己注意に対応するのは、同じ系列の要素同士を比較して文脈を作る処理である。
同じ章で確認したい用語
到達チェック
- Self-Attentionを一文で説明できる
- 同じ章の似た用語と違いを説明できる
- 問題文の具体例から、Self-Attentionに関係する論点を拾える
- 関連問題を解き、誤答した選択肢の理由を確認できる
執筆: ミナト編集部(運営者情報を見る)