AI資格ドリル
資格を選ぶ↓

G検定 用語解説

コーパスとは

自然言語処理のモデル学習に用いる、大量の文章データを収集・構造化したデータ集合。

まず押さえる結論

コーパスは、G検定の「大項目7 AIの社会実装に向けて」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-07-03。

試験概要(公式)

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

×CRISP-DM(進め方の枠組み)とPoC(概念実証)の役割の取り違え。

×データリーケージ(学習・評価データに正解情報が混入する事故)の見落とし。

×説明可能AI(XAI)・公平性・透明性など、近い概念の取り違え。

関連する確認問題

大項目7 AIの社会実装に向けて / データの整備と運用

運用中のAIで、時間の経過により入力データの傾向や正解との関係が変わり、モデル性能が低下する現象はどれか。

正解は「概念ドリフト」である。概念ドリフトは、運用中にデータの分布や入力と正解の関係が変化し、学習時には高かったモデル性能が低下する現象である。データリーケージは本来使えない情報の混入、アノテーションはラベル付け、オープンデータは公開データである。 時間軸と原因を区別する。データリーケージは学習時の情報漏れ、アノテーションはラベル付与、オープンデータは公開データである。顧客行動や環境変化により学習時の関係が現在とずれるのが概念ドリフトで、監視と再学習が必要になる。

大項目7 AIの社会実装に向けて / AIの説明性・公平性

AIの判断について、関係者に対して説明し責任を果たせる状態を重視する考え方として最も適切なものはどれか。

正解は「アカウンタビリティ(説明責任)」である。アカウンタビリティは、AIの判断や運用について関係者に説明し責任を果たす観点であり、説明可能AIや透明性とも関係する。クラウドは計算資源の利用形態、内製と外注は開発体制、価値創出は事業成果に関する観点である。 技術・体制・事業成果と責務を区別する。クラウドは計算資源、内製と外注は開発体制、価値創出は事業目的である。誰が判断に責任を持ち、経緯・根拠・対応を説明するかを求めるのがアカウンタビリティである。

大項目7 AIの社会実装に向けて / AIプロジェクトの進め方

データ分析プロジェクトを、ビジネス理解、データ理解、モデリング、評価、展開などの流れで進める標準的なプロセスはどれか。

正解は「CRISP-DM」である。この設問が問うているのは、データ分析プロジェクトを立ち上げてから展開に至るまでの標準的な工程がどう呼ばれるかという、プロジェクトマネジメントの枠組みそのものである。CRISP-DMは、ビジネス理解・データ理解・モデリング・評価・展開という流れを反復しながら進める代表的な工程モデルであり、AI導入プロジェクトの土台として位置づけられる。残る3つの選択肢は、いずれも「プロジェクトの進め方を定める工程モデル」という主題自体から外れ、それぞれ別の局面を指す語である点で一括りにできる。MLOpsはモデルを本番投入した後の運用・再学習の仕組み、FATは公平性・説明責任・透明性というAIに求められる性質、RLHFは人間のフィードバックを用いた強化学習の手法であり、いずれもプロジェクトの立ち上げから展開までの段階を規定する語ではない。

同じ章で確認したい用語

到達チェック

  • コーパスを一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、コーパスに関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部運営者情報を見る