用語比較
BERTとGPTの違い
BERTとGPTは、どちらもTransformerをもとにした事前学習済みの言語モデルという説明が似ているため、設問の記述を逆に選びやすい組み合わせです。違いは、事前学習でどんなタスクを解かせるか、そしてそのとき参照できる文脈の向きにあります。
BERTの原論文(arXiv 1810.04805)は、文中のトークンの一部をランダムに隠し、周囲の文脈からその単語を予測させるMasked LM(MLM)と、2つの文が実際に連続するかどうかを判定させるNext Sentence Prediction(NSP)という2つの教師なしタスクで事前学習します。一方、GPT-1の原論文「Improving Language Understanding by Generative Pre-Training」(Radford et al., 2018)は、標準的な言語モデルの目的関数を採用し、各トークンをそれ以前の文脈だけから予測するように、多層のTransformer decoderを事前学習します。
このページは、事前学習の説明文がある設問で「双方向」「隠す」という語と「それまでの出力」「次を予測」という語を読み分けられず、BERTとGPTの記述を逆に選んでしまう人を対象にしています。設問中の手掛かり語を、事前学習タスクの目的(隠して当てるのか、次を予測するのか)と参照する文脈の向き(前後の双方向か、左から右のみか)に分解して判定します。
この記事の目次
この記事の根拠と出典
本文の主要なセクションでは、公式一次資料と照合した内容と編集部の整理を、見出しの下のラベルで区別しています。 試験日、料金、申込条件、試験方式など変動する情報は、公式情報を最終確認してください。 当サイトの一次情報確認日: 2026-08-31。
結論
BERT
文中の一部トークンを隠すMLMと、2文の連続性を判定するNSPを使い、前後(双方向)の文脈から事前学習する。
GPT
直前までのトークン列だけから次のトークンを予測する言語モデルの目的関数で、左から右へ自己回帰的に事前学習する(GPT-1原論文)。
違いを表で確認
| 比較軸 | BERT | GPT |
|---|---|---|
| 事前学習の目的関数 | 文中の一部トークンを隠すMLMと、2文の連続性を判定するNSP | 直前までのトークン列だけから次のトークンを予測する標準的な言語モデルの目的関数 |
| 参照する文脈の向き | 前後(双方向)の文脈を同時に見る | 左から右への一方向(自己回帰) |
| 設問の手掛かり語 | マスク、隠す、当てる、双方向、2文の関係、連続性 | それまでの出力、次の単語、順番に予測・生成、左から右 |
| モデルの位置づけ | BERTモデル(MLM・NSPで事前学習する言語モデル) | GPTモデル・自己回帰モデル(多層Transformer decoderを使う) |
| 一緒に出やすい語 | RoBERTa、ALBERTなどの派生モデル | ファインチューニング、プレトレーニング、パラメータ |
どこで迷っているかを切り分ける
双方向と自己回帰の違いが分からない初学者
BERTは、隠したトークンの前後にある単語をどちらも見て予測するため双方向です。GPTは、Transformer decoderの仕組み上、ある位置の予測が後続の位置を参照できず、それまでに生成した出力だけを新たな入力として次の値を順番に予測します。「前後どちらも見えるか」「それまでの出力しか見えないか」で切り分けます。
MLM・NSPとGPTの目的関数を同じ「事前学習」でひとくくりにする人
どちらも教師なしで大量のテキストから学習する点は共通ですが、解かせるタスクが違います。BERTは隠した単語を当てるMLMと2文の連続性を判定するNSPの2つ、GPTは直前の文脈から次のトークンを予測する単一の言語モデルの目的関数です。「2つのタスクを組み合わせているか」「1つの予測タスクだけか」を確認します。
BERTモデル・GPTモデルの用途を混同する再受験者
BERTモデルはMLM・NSPで事前学習する言語モデルとして定義され、GPTモデルは大量のテキストで事前学習した文章生成向けの言語モデルです。設問が「隠された単語や2文の関係を判定する事前学習」の説明であればBERT、「それまでの出力から次の値を順番に予測・生成する」自己回帰モデルの説明であればGPTだと整理します。
具体例で使い分ける
例 1
「一部の単語を隠して当てさせる」「2つの文が連続するか判定する」という設問
事前学習の説明として、文中の一部の単語を隠して周囲の文脈から予測させる処理と、2つの文が連続する関係にあるかを判定させる処理が挙げられている場面です。
- 「隠す」「当てさせる」という語は、文中のトークンをランダムに隠して予測するMasked LM(MLM)の説明です。
- 「2つの文が連続するか」という語は、Next Sentence Prediction(NSP)の説明です。
- 隠した単語の前後どちらの文脈も使う点が、双方向の事前学習であることの手掛かりです。
結論: MLMとNSPによる双方向の事前学習の説明なので、BERTを選びます。
例 2
「それまでに生成した出力だけを使って次の値を予測する」という設問
事前学習の説明として、それまでに生成した出力を新たな入力とし、次の値を順番に予測・生成していく処理が挙げられている場面です。
- 「それまでの出力」「次の値を順番に予測」という語は、自己回帰モデルの説明です。
- 後ろの文脈を使わず、直前までの文脈だけを使う点が、左から右への一方向の事前学習であることの手掛かりです。
- GPT-1の原論文は、この処理を多層のTransformer decoderで学習する言語モデルの目的関数として定義しています。
結論: 直前の文脈だけを使う自己回帰的な事前学習の説明なので、GPTを選びます。
例 3
「双方向」と「次を予測」という語が同じ設問文に混在する
設問の選択肢や解説文に「双方向」という語と「次の単語を予測する」という語が両方登場し、どちらのモデルの説明か迷う場面です。
- 「双方向」という語がどの処理にかかっているかを先に確認します。隠した単語を前後の文脈から当てる処理にかかっていればMLM(BERT)の説明です。
- 「次を予測する」という語が、それまでの出力だけを使って順番に予測する処理を指していれば、自己回帰(GPT)の説明です。
- 2つの語が同じ設問に出ていても、どちらのモデルの事前学習タスクを指しているかは別々に判定できます。
結論: 語の対応関係を分解すれば、双方向の部分はBERT、次を予測する部分はGPTの説明だと判断できます。
問題文から答えを選ぶ手順
- 1
「隠して当てる」か「次を予測する」かを見る
文中のトークンを隠して周囲から当てる説明ならMLM(BERT)、それまでの出力だけから次の値を予測する説明なら自己回帰(GPT)を疑います。
- 2
「双方向」か「左から右」かを見る
隠した単語の前後どちらの文脈も使うなら双方向(BERT)、直前までの文脈しか使わないなら左から右への一方向(GPT)です。
- 3
「2文の関係」を判定する記述があるか見る
2つの文が連続するかどうかを判定する説明があれば、NSPの説明としてBERT側に分類します。
- 4
隣接概念を除外する
事前学習後にモデルを追加調整する話はファインチューニング、事前学習そのものを指す話とは区別します。単一のモデル名だけで即答せず、事前学習タスクの記述に戻って判断します。
試験での見分け方
- 1文中の一部を隠して周囲の文脈から当てる説明はMLM、BERTの手掛かり。
- 22つの文が連続するかを判定する説明はNSP、BERTの手掛かり。
- 3それまでの出力だけを使って次の値を順番に予測する説明は自己回帰、GPTの手掛かり。
- 4前後どちらの文脈も使うなら双方向(BERT)、直前までの文脈しか使わないなら左から右(GPT)。
- 5「双方向」「次を予測」という語が同じ設問にあっても、どの処理にかかっているかを分けて読む。
- 6モデル名の丸暗記ではなく、事前学習タスクの目的と参照する文脈の向きで判定する。
誤答しやすい選択肢
BERTとGPTをどちらも「事前学習するモデル」とだけ覚える
修正: 事前学習で解かせるタスクが違います。BERTはMLM・NSPの2タスク、GPTは直前の文脈から次のトークンを予測する言語モデルの目的関数だと区別します。
双方向と自己回帰を逆に覚える
修正: 隠した単語の前後を見るのが双方向(BERT)、それまでの出力だけを見るのが自己回帰(GPT)です。「前後どちらも」か「直前まで」かで判定します。
NSPをMLMと同じ処理だと思う
修正: MLMは単語を隠して当てるタスク、NSPは2つの文が連続するかを判定するタスクです。どちらもBERTの事前学習タスクですが、扱う対象が単語か文の関係かで異なります。
自己回帰モデルをGPT以外の何らかの新しい概念だと思う
修正: 自己回帰モデルは、それまでに生成した出力を新たな入力として次の値を順番に予測・生成するモデルの総称で、GPTモデルはその代表例として説明される位置づけです。
確認問題
Q1文中のトークンの一部を隠し、周囲の文脈から予測させる事前学習タスクは?
答え: MLM(Masked Language Model)
「隠す」「周囲の文脈から予測」という語がMLMの説明です。BERTの事前学習タスクの一つです。
Q22つの文が実際に連続する関係にあるかどうかを判定させる、BERTの事前学習タスクは?
答え: NSP(Next Sentence Prediction)
「2つの文」「連続する関係」という語がNSPの説明です。MLMと組み合わせて用いられます。
Q3それまでに生成した出力を新たな入力として用い、直前までの文脈だけから次の値を順番に予測・生成するモデルは?
答え: 自己回帰モデル(GPTなど)
後ろの文脈を使わず、直前までの文脈だけを使う点が自己回帰モデルの説明です。GPT-1の原論文も、この目的でTransformer decoderを事前学習します。
到達チェック
- MLMを「隠して当てる」、NSPを「2文の連続性を判定する」処理として説明できる
- BERTを双方向、GPTを左から右への自己回帰として区別できる
- 自己回帰モデルを「それまでの出力を新たな入力として使う」処理として説明できる
- 設問文の「双方向」「次を予測」という語がどちらの処理にかかっているかを分解して読める
- 事前学習タスクの目的とファインチューニングの違いを区別できる
関連ページで確認する
- MLM(Masked Language Model)を個別に確認文中の一部を隠して当てさせる事前学習タスクを確認する。
- NSP(Next Sentence Prediction)を個別に確認2つの文の連続性を判定する事前学習タスクを確認する。
- 自己回帰モデルを個別に確認それまでの出力を新たな入力として使う予測・生成の仕組みを確認する。
- BERTモデルを個別に確認MLM・NSPで事前学習する言語モデルの位置づけを確認する。
- GPTモデルを個別に確認大量のテキストで事前学習する文章生成向けの言語モデルを確認する。
- 生成AI(ジェネレーティブAI)の章を読むBERT・GPTを含む生成AIの仕組みを収録問題の解説で確認する。
- 生成AIパスポート問題生成AIの仕組み、活用、リスクを横断して演習する。
よくある質問
QBERTとGPTはどちらが新しい?
それぞれ独立した事前学習の目的で設計されたモデルであり、新旧よりも解かせるタスク(双方向のMLM・NSPか、左から右の自己回帰か)の違いで見分けます。
QBERTは文章を生成できない?
このページで扱う原論文の事前学習タスクはMLM・NSPによる双方向の言語理解が中心で、GPTのように直前の文脈から次のトークンを順番に生成する自己回帰の目的とは設計が異なります。
Q試験ではどの語で見分ける?
「隠す」「当てる」「双方向」「2文の関係」ならBERT(MLM・NSP)、「それまでの出力」「次を予測」「左から右」なら自己回帰(GPT)を疑います。
Q自己回帰モデルはGPT以外にもある?
自己回帰モデルは、それまでの出力を新たな入力として次の値を順番に予測・生成するモデルの総称で、GPTモデルはその代表例として位置づけられます。
執筆: ミナト編集部(運営者情報を見る)