AI資格ドリル
資格を選ぶ↓

G検定 用語解説

データリーケージとは

学習・評価データに本来使えない正解情報が混入し、性能を過大評価してしまう事故。

まず押さえる結論

データリーケージは、G検定の「大項目7 AIの社会実装に向けて」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-07-03。

試験概要(公式)

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

×CRISP-DM(進め方の枠組み)とPoC(概念実証)の役割の取り違え。

×データリーケージ(学習・評価データに正解情報が混入する事故)の見落とし。

×説明可能AI(XAI)・公平性・透明性など、近い概念の取り違え。

関連する確認問題

大項目7 AIの社会実装に向けて / データの整備と運用

運用中の機械学習モデルについて、時間の経過とともに入力データの傾向や、入力と出力の関係が変化していき、モデルの予測精度が徐々に低下していく現象を何というか。

正解は「概念ドリフト」である。概念ドリフトは、時間の経過とともに入力データの傾向や、入力と出力の関係そのものが変化していき、運用中のモデルの予測精度が徐々に低下していく現象である。運用後の再学習・監視(MLOps)が重要になる。データリーケージは学習時に正解情報が混入する事故、過学習は訓練データに適合しすぎる現象、アノテーションはラベル付け作業であり、いずれも運用中の傾向変化による精度低下を指す語ではない。 問題が生じる時点を区別する。データリーケージは学習・検証時の情報漏れ、過学習は訓練データへの過度な適合、アノテーションはラベル付与作業である。本番運用後に環境や顧客行動が変わり関係がずれるのは概念ドリフトである。

大項目7 AIの社会実装に向けて / AIプロジェクトの進め方

製造現場の異常検知AIを導入する際、データ分析の技術だけでなく、どの状態を異常と扱うべきか、現場の工程や安全条件を理解していることが求められる。この業務領域に固有の知識を何というか。

正解は「ドメイン知識」である。ドメイン知識は、製造、医療、金融など特定の業務領域に固有の知識を指す。AIプロジェクトでは、技術者と現場の知識を持つ人が協力し、課題設定や評価基準を定める必要がある。オープンデータは公開データ、データリーケージは本来利用できない情報の混入、敵対的サンプルは誤認を誘う入力であり、業務領域の知識ではない。設問の製造工程、安全条件、異常の定義は、データの公開状態や学習時の混入ではなく、現場業務を理解するための知識を示す。AI技術の用語ではなく、判断基準を定める業務側の知識を選ぶ。

大項目7 AIの社会実装に向けて / AIの説明性・公平性

融資審査AIの判断について、なぜ否決されたのかを利用者や監査担当者に説明できるようにする観点として最も適切なものはどれか。

正解は「説明可能AI(XAI)」である。説明可能AI(XAI)は、AIの判断理由や根拠を人が理解できる形で説明するための考え方で、融資審査のように説明責任が問われる場面で重要になる。データリーケージは評価時に本来使えない情報が混入する問題、オープンデータは公開データ、GPUは計算資源であり、判断理由の説明という観点ではない。 説明責任を支える具体的なモデル解釈技術を問う。データリーケージは情報混入事故、オープンデータは公開条件、GPUは計算装置である。特徴寄与度や局所説明などで判断理由を説明可能にするのがXAIである。

同じ章で確認したい用語

到達チェック

  • データリーケージを一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、データリーケージに関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部運営者情報を見る