AI資格ドリル
資格を選ぶ↓

DS検定 用語解説

離散化とは

連続的な数値データを、一定の範囲ごとに区切ってカテゴリ(区分)に変換する処理。特徴量エンジニアリングの手法の1つ。

まず押さえる結論

離散化は、DS検定の「第5章 データ準備・可視化技法とモデル化」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-10-02。

試験概要(公式)

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

「第5章 データ準備・可視化技法とモデル化」の問題で、取り違えやすい組み合わせです。

  • 標本誤差とサンプリングバイアスの混同。標本誤差は標本抽出に伴う偶然のばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差。
  • 過学習を『精度が高いこと』と誤解する。訓練データに過剰適合し未知データへの汎化性能が下がる問題として理解する必要がある。
  • Precision(適合率)とRecall(再現率)の取り違え。目的(見逃しを減らしたいか、誤検知を減らしたいか)によって重視する指標が変わる。

関連する確認問題

第5章 データ準備・可視化技法とモデル化 / データ準備

データ準備の処理についての説明として、誤っているものはどれか。

誤っている説明を選ぶので、前処理の名称の取り違えを探す。正解は「標準化は、連続した数値を区間に区切ってカテゴリにする変換である」である。連続した数値を区間に区切ってカテゴリにするのは離散化で、標準化は、数値特徴量の平均やばらつきをそろえる前処理である。対数変換が大きな値の差を抑える変換であること、ダミー変数がカテゴリを0と1の列に置き換えたものであること、欠損値がデータの一部が記録されていない値であることは、正しい説明である。したがって、標準化に離散化の内容を当てはめた説明が、設問の誤った説明である。

第5章 データ準備・可視化技法とモデル化 / データ準備

連続した数値データを、一定の区間ごとのカテゴリとして扱えるように変換する特徴量化はどれか。

正解は「離散化」である。離散化は連続した数値データをいくつかの区間に分け、カテゴリのように扱える形へ変換する特徴量化である。標準化は数値の尺度をそろえるための変換、対数変換は数値に対数を用いる変換であり、いずれも値を区間ごとのカテゴリに分ける操作ではない。ダミー変数はカテゴリを数値として表すための変数であり、連続値を最初に区間へ分ける処理とは役割が異なる。設問では数値の大きさを調整するのか、区間に分けるのか、カテゴリを表す変数を作るのかを区別する。したがって離散化を選ぶ。

第5章 データ準備・可視化技法とモデル化 / データ準備

一部の顧客だけ購入額が非常に大きく、購入額の分布が強く偏っている。値に対数をとって分布の歪みを小さくする処理はどれか。

正解は「対数変換」である。対数変換は、数値データに対数をとることで、大きな値の影響を圧縮し、分布の偏りや歪みを小さくする変換処理である。設問では少数の非常に大きい購入額によって分布が偏っており、値に対数をとると明示されているため対数変換を選ぶ。標準化は平均や標準偏差を基準に尺度をそろえる処理、離散化は連続値を区間ごとのカテゴリへ変える処理、ダミー変数化はカテゴリを数値列で表す処理である。何を改善したいかと、値にどの演算を施すかを対応させる。

同じ章で確認したい用語

到達チェック

  • 離散化を一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、離散化に関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部(運営者情報を見る)