AI資格ドリル
資格を選ぶ↓

生成AIアドバイザー認定試験 用語解説

学習データとは

モデルが学習に使う文章・画像などのデータ。言語モデルでは学習データの量を学習トークン数で数える。2022年の論文は、400以上の言語モデル(パラメータ7000万〜160億超、学習トークン50億〜5000億)を訓練して調べ、計算量が限られるなら、モデルの大きさと学習トークン数を同じ割合で増やすのがよいと報告している。モデルの大きさが2倍になるなら、学習トークン数も2倍にする考え方である。この予測に沿って、パラメータ700億で同じ計算量のGopher(2800億)より約4倍のデータを使ったChinchillaは、多くの評価課題でGopherなどを上回ったという。公式シラバスでは第2課題の第2章「トークン・パラメータ」で、トークン・パラメータと並べて三要素の関係が問われる。

まず押さえる結論

学習データは、生成AIアドバイザー認定試験の「第2課題 生成AIの基礎理解」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-10-04。

試験概要(公式)

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

「第2課題 生成AIの基礎理解」の問題で、取り違えやすい組み合わせです。

  • 大規模言語モデル・拡散モデル・GANの説明の取り違え。次の語を予測するのが大規模言語モデル、ノイズを段階的に取り除くのが拡散モデル、作る側と見分ける側が競い合うのがGANである。
  • トークン・パラメータ・学習データの混同。トークンは文章を処理する単位、パラメータは学習で調整される数値、学習データは学習に使う文章などの集まりである。
  • 生成AIの特徴を、データを使わない、または誤りが起こらないと考えること。生成AIもデータから学習して動き、新しい文章や画像を作れる一方で、誤りも起こる。

関連する確認問題

第2課題 生成AIの基礎理解 / 第2章 トークン・パラメータ

大規模言語モデルにおける「トークン」の説明として、最も適切なものはどれか。

正解は「モデルが文章を処理するときに使う、語や語の断片といった文字列の区切りの単位である」である。大規模言語モデルは、入力された文章をまずトークンに分けてから処理する。学習で調整される数値の総数はパラメータ、学習に使う文章の集まりは学習データという別の用語で、トークンはその文章を区切った処理の単位にあたる。認証用の番号という日常語の意味とは異なる点にも注意が必要である。トークン、パラメータ、学習データの3つは、役割の違いで区別して覚える。

第2課題 生成AIの基礎理解 / 第3章 従来のAI(機械学習、ルールベース)との違い

従来の機械学習AIと比べたときの、生成AIの特徴として最も適切なものはどれか。

正解は「文章や画像などの新しいコンテンツを作り出せる点」である。従来の機械学習AIは、データから学習して判断や予測を行う使い方が中心だった。生成AIの登場により、文章や画像のような新しいコンテンツを作り出す使い方が広がった。データを一切使わないという説明は誤りで、生成AIも学習データから学習して動く。人が書いたルールだけで動くのはルールベースAIの説明であり、誤りが一切起こらないという説明もハルシネーションの存在と合わない。新しいコンテンツを作る点が、生成AI固有の特徴である。

同じ章で確認したい用語

到達チェック

  • 学習データを一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、学習データに関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部(運営者情報を見る)