生成AIアドバイザー認定試験 用語解説
マルチモーダルAIとは
文章だけでなく画像など、複数の種類の情報を入力として受け取れるAI。OpenAIのGPT-4の技術報告は、GPT-4を「画像と文章を入力でき、文章を出力する大規模なマルチモーダルモデル」と説明している。つまり入力は複数の種類でも、出力は文章だけという組み合わせもある。また同報告は、GPT-4がTransformerをもとに、文書の次のトークンを予測するよう事前学習したモデルであるとも述べている。公式シラバスでは第8課題の第1章「マルチモーダルAI(テキスト+画像+音声+動画)」で扱われ、複数の種類のデータを組み合わせて扱う点が問われる。
この記事の目次
まず押さえる結論
マルチモーダルAIは、生成AIアドバイザー認定試験の「第8課題 最新動向・将来展望」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。
情報源と編集区分
公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-10-04。
試験概要(公式)試験での問われ方
定義の言い換え
用語そのものではなく、説明文の一部を言い換えて出されることがあります。
似た概念との比較
同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。
具体例からの判断
問題文の事例が、定義のどの部分に対応しているかを先に確認します。
誤答しやすいポイント
「第8課題 最新動向・将来展望」の問題で、取り違えやすい組み合わせです。
- AIエージェントを、1回の質問に1回答える通常の対話と同じものと考えること。AIエージェントは目標に向けて自ら手順を考え、複数の作業を進める点が特徴である。
- AI事業者ガイドラインを、操作手順書や利用を禁止する決まりと取り違えること。AIに関わる事業者が安全・安心に活用するために参照する指針である。
- 各分野で利用が広がったことを、出力の確認が不要になった理由と考えること。医療・金融・教育など分野ごとに求められる正確さや決まりが異なり、人の確認は引き続き必要である。
関連する確認問題
第8課題 最新動向・将来展望 / 第1章 マルチモーダルAI(テキスト+画像+音声+動画)
「マルチモーダルAI」の説明として、最も適切なものはどれか。
正解は「テキスト、画像、音声、動画など、複数の種類のデータを組み合わせて扱えるAI」である。マルチモーダルAIの「マルチ」は複数、「モーダル」はデータの種類を表し、たとえば画像を見て文章で説明するように、種類の異なるデータをまたいで処理できる点が特徴である。テキストだけを扱うAIは種類が一つに限られる。利用者数の多さはデータの種類と関係がなく、ルールベースは人がルールを書いて動かす方式の説明である。言葉の意味から考えれば迷いにくい。データの種類が複数かどうかに着目するとよい。
同じ章で確認したい用語
到達チェック
- マルチモーダルAIを一文で説明できる
- 同じ章の似た用語と違いを説明できる
- 問題文の具体例から、マルチモーダルAIに関係する論点を拾える
- 関連問題を解き、誤答した選択肢の理由を確認できる
執筆: ミナト編集部(運営者情報を見る)