用語比較
プロンプトインジェクションとジェイルブレイクの違い
プロンプトインジェクションとジェイルブレイクは、どちらも生成AIへの入力で不正な挙動を引き出す話として並べて語られ、混同されやすい言葉です。生成AIパスポートでは、第4章「生成AIの代表的リスク」の学習項目と、AIエージェントのリスク・安全性・評価の項目にプロンプトインジェクションが含まれます。
OWASP(Webアプリケーションなどのセキュリティを扱う国際的な非営利団体)のGenAI Security Projectは、ジェイルブレイクをプロンプトインジェクションの一形態と整理しています。つまり、範囲が広いのがプロンプトインジェクション、その中で安全対策を無視させることを狙うものがジェイルブレイクです。
同じ文書は、両者がしばしば同じ意味で使われるとも述べています。そのため、試験や記事で一方の名前だけが出ても、もう一方を排除しない読み方が必要です。
このページは、二つを完全に別の攻撃だと思っている人や、まったく同じ意味だと思っている人を対象にしています。見分けるポイントは、狙いが挙動の変更全般か、安全対策の無効化かです。なお、この整理はOWASPの文書によるもので、JDLAの公式シラバスの文言ではありません。
この記事の目次
この記事の根拠と出典
本文の主要なセクションでは、公式一次資料と照合した内容と編集部の整理を、見出しの下のラベルで区別しています。 試験日、料金、申込条件、試験方式など変動する情報は、公式情報を最終確認してください。生成AIパスポートの一次情報確認日: 2026-08-31。
結論
プロンプトインジェクション
ユーザーのプロンプトがLLMの挙動や出力を意図しない形で変えてしまうこと。安全対策の回避を含むこともある。ジェイルブレイクを含む広い言葉です。
ジェイルブレイク
モデルに安全プロトコルを完全に無視させる入力を与えること。プロンプトインジェクションの一形態。
違いを表で確認
| 比較軸 | プロンプトインジェクション | ジェイルブレイク |
|---|---|---|
| 範囲 | 広い。挙動を意図しない形で変えること全般 | 狭い。プロンプトインジェクションの一形態 |
| 狙い | 特定の入力で応答を操作する。安全対策の回避を含むこともある | モデルに安全プロトコルを完全に無視させる |
| 入力の経路 | ユーザーが直接入れる直接型と、ウェブサイトやファイルなど外部の情報源から入る間接型がある | 経路に関わらず、安全プロトコルの無視を狙う入力ならこれに当たる |
| 意図 | 意図的な場合も、ユーザーが意図せず起こす場合もある | 安全対策を無視させる入力を与える、という点が特徴 |
| 予防の考え方 | システムプロンプトや入力処理に保護策を組み込める | 効果的な防止には、モデルの学習や安全機構の継続的な更新が必要 |
| 両者の関係 | しばしばジェイルブレイクと同じ意味で使われる | プロンプトインジェクションの一部として位置づけられる |
どこで迷っているかを切り分ける
二つを別の攻撃だと思っている人
OWASPの整理では、ジェイルブレイクはプロンプトインジェクションの一形態です。別の攻撃として並べるより、包含関係で覚えます。
どちらもまったく同じ意味だと思っている人
実際には同じ意味で使われることも多いのですが、プロンプトインジェクションの方が広く、安全対策の無効化に限らない挙動の変更も含みます。
AIエージェントの安全性を学ぶ人
外部のウェブページやファイルを読み込むAIでは、その外部内容で挙動が変わる間接型が問題になります。ユーザーが直接入力する場合だけを想定すると見落とします。
具体例で使い分ける
例 1
ユーザーの入力で応答の方針を変えさせる
利用者が入力欄に、本来の指示とは別の動作をさせる文を書き込み、モデルの出力が意図しない形に変わる場面です。説明用の仮の例です。
- ユーザーのプロンプトがモデルの挙動を意図しない形で変えています。
- 入力がユーザーから直接入っているので、直接型にあたります。
結論: プロンプトインジェクション(直接型)です。
例 2
外部のウェブページの内容でAIの動作が変わる
AIが要約のために読み込んだウェブページの中に、AIの動作を変える文が含まれていて、出力が意図しない形になる場面です。説明用の仮の例です。
- 入力は利用者ではなく、ウェブサイトという外部の情報源から入っています。
- 外部内容によって挙動が変わるので、間接型の特徴に合います。
結論: プロンプトインジェクション(間接型)です。ジェイルブレイクかどうかは、安全対策を無視させているかで判断します。
例 3
モデルの安全対策を完全に無視させる
モデルが守るはずの安全上の制約を無視した出力をするように、入力で仕向ける場面です。
- 狙いは挙動の変更一般ではなく、安全プロトコルの無視です。
- OWASPは、これをプロンプトインジェクションの一形態と整理しています。
結論: ジェイルブレイクです。同時に、広い意味ではプロンプトインジェクションの一部でもあります。
問題文から答えを選ぶ手順
- 1
モデルの挙動が意図しない形に変わったかを見る
入力によって挙動や出力が意図しない形に変わっていれば、プロンプトインジェクションの話です。
- 2
入力がどこから入ったかを確認する
ユーザーが直接入力したなら直接型、ウェブサイトやファイルなど外部の情報源の内容によるなら間接型です。
- 3
狙いが安全対策の無視かを確認する
モデルに安全プロトコルを完全に無視させることが狙いなら、ジェイルブレイクです。それ以外の挙動の変更は、ジェイルブレイクとは限りません。
- 4
対策を分けて考える
システムプロンプトや入力処理での保護策は、プロンプトインジェクション全般への備えです。ジェイルブレイクの防止には、モデルの学習や安全機構の更新も必要です。
試験での見分け方
- 1挙動を意図しない形に変える入力全般はプロンプトインジェクション。
- 2安全プロトコルを完全に無視させる入力はジェイルブレイク。
- 3ジェイルブレイクはプロンプトインジェクションの一形態。
- 4外部の情報源から入る場合は間接型、ユーザーが直接入れる場合は直接型。
- 5入力側の保護策だけでは、ジェイルブレイクを防ぐのに十分とはいえない。
誤答しやすい選択肢
ジェイルブレイクをプロンプトインジェクションとは別のものと考える
修正: OWASPの整理では、ジェイルブレイクはプロンプトインジェクションの一形態です。包含関係で覚えます。
プロンプトインジェクションはユーザーが直接入力するものだけと考える
修正: ウェブサイトやファイルなど外部の情報源から入る間接型もあります。
プロンプトインジェクションは必ず悪意のある攻撃だと考える
修正: OWASPは、直接型も間接型も意図的な場合と意図しない場合があると述べています。
入力の保護策だけで十分だと考える
修正: 保護策で軽減できても、ジェイルブレイクの効果的な防止にはモデルの学習や安全機構の継続的な更新が必要とされています。
確認問題
Q1プロンプトインジェクションとジェイルブレイクで、範囲が広いのは?
答え: プロンプトインジェクション
ジェイルブレイクは、プロンプトインジェクションの一形態です。
Q2ウェブサイトやファイルなど外部の情報源の内容でモデルの挙動が変わるタイプは?
答え: 間接型のプロンプトインジェクション
ユーザーが直接入れる直接型に対し、外部の情報源から入るものを間接型といいます。
Q3モデルに安全プロトコルを完全に無視させる入力を与えることは?
答え: ジェイルブレイク
プロンプトインジェクションの中でも、安全対策の無視を狙うものです。
Q4プロンプトインジェクションは必ず意図的な攻撃?
答え: 必ずしもそうではない
ユーザーが意図せず、予期しない挙動を引き起こす入力をする場合もあります。
到達チェック
- ジェイルブレイクがプロンプトインジェクションの一形態と説明できる
- 直接型と間接型の違いを説明できる
- プロンプトインジェクションが意図しない場合にも起こりうると分かる
- システムプロンプトでの保護策だけに頼れない場合があると分かる
- この整理がOWASPの文書で、JDLAの文言ではないと分かる
関連ページで確認する
よくある質問
Qプロンプトインジェクションとジェイルブレイクは何が違う?
ジェイルブレイクはプロンプトインジェクションの一形態です。プロンプトインジェクションは挙動を意図しない形に変える入力全般、ジェイルブレイクはモデルに安全プロトコルを完全に無視させる入力を指します。
Q二つは同じ意味で使われる?
OWASPの文書は、両者がしばしば同じ意味で使われると述べています。ただし、厳密にはプロンプトインジェクションの方が広い言葉です。
Q直接型と間接型は何が違う?
直接型はユーザーの入力が直接モデルの挙動を変えるもの、間接型はウェブサイトやファイルなど外部の情報源の内容がモデルの挙動を変えるものです。
Q人に見えない入力でも影響する?
OWASPは、人に見えない入力でも、モデルが解析する内容であれば影響しうると述べています。
Qプロンプトインジェクションは生成AIパスポートで問われる?
新シラバスの第4章「生成AIの代表的リスク」の学習項目と、AIエージェントのリスク・安全性・評価の項目にプロンプトインジェクションが含まれます。ジェイルブレイクの整理はOWASPの文書によるもので、公式シラバスの文言ではありません。
執筆: ミナト編集部(運営者情報を見る)