AI資格ドリル
資格を選ぶ↓

生成AIアドバイザー認定試験 用語解説

マルチモーダルAIとは

文章だけでなく画像など、複数の種類の情報を入力として受け取れるAI。OpenAIのGPT-4の技術報告は、GPT-4を「画像と文章を入力でき、文章を出力する大規模なマルチモーダルモデル」と説明している。つまり入力は複数の種類でも、出力は文章だけという組み合わせもある。また同報告は、GPT-4がTransformerをもとに、文書の次のトークンを予測するよう事前学習したモデルであるとも述べている。公式シラバスでは第8課題の第1章「マルチモーダルAI(テキスト+画像+音声+動画)」で扱われ、複数の種類のデータを組み合わせて扱う点が問われる。

まず押さえる結論

マルチモーダルAIは、生成AIアドバイザー認定試験の「第8課題 最新動向・将来展望」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-10-04。

試験概要(公式)

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

「第8課題 最新動向・将来展望」の問題で、取り違えやすい組み合わせです。

  • AIエージェントを、1回の質問に1回答える通常の対話と同じものと考えること。AIエージェントは目標に向けて自ら手順を考え、複数の作業を進める点が特徴である。
  • AI事業者ガイドラインを、操作手順書や利用を禁止する決まりと取り違えること。AIに関わる事業者が安全・安心に活用するために参照する指針である。
  • 各分野で利用が広がったことを、出力の確認が不要になった理由と考えること。医療・金融・教育など分野ごとに求められる正確さや決まりが異なり、人の確認は引き続き必要である。

関連する確認問題

第8課題 最新動向・将来展望 / 第1章 マルチモーダルAI(テキスト+画像+音声+動画)

「マルチモーダルAI」の説明として、最も適切なものはどれか。

正解は「テキスト、画像、音声、動画など、複数の種類のデータを組み合わせて扱えるAI」である。マルチモーダルAIの「マルチ」は複数、「モーダル」はデータの種類を表し、たとえば画像を見て文章で説明するように、種類の異なるデータをまたいで処理できる点が特徴である。テキストだけを扱うAIは種類が一つに限られる。利用者数の多さはデータの種類と関係がなく、ルールベースは人がルールを書いて動かす方式の説明である。言葉の意味から考えれば迷いにくい。データの種類が複数かどうかに着目するとよい。

同じ章で確認したい用語

到達チェック

  • マルチモーダルAIを一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、マルチモーダルAIに関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部(運営者情報を見る)