AI資格ドリル
資格を選ぶ↓

G検定 大項目3 機械学習の概要 予想問題と解説

G検定大項目3 機械学習の概要」の予想問題を49収録しています。このページでは代表42問を解説つきで掲載し、全問は演習画面で解けます。公式シラバスの範囲で作成しています。

この章の要点

機械学習の種類・代表的な手法・モデルの評価と過学習・前処理とハイパーパラメータなどを扱う分野です。49(基礎9問・標準19問・応用21問)を収録しています。

  • 機械学習の種類
  • 代表的な手法
  • モデルの評価と過学習
  • 前処理とハイパーパラメータ

情報源と編集区分

公式範囲を確認し、問題数・難易度・確認点は当サイトが集計・編集。 一次情報確認日: 2026-07-03。

試験概要(公式)

確認しておきたいポイント

当サイトの作問時に観察した、取り違えやすい論点です(公式の統計ではありません)。

  • 教師あり・教師なし・強化学習の分類の取り違え(分類/回帰=教師あり、クラスタリング/次元削減=教師なし)。
  • L1正則化(ラッソ=係数が0になり変数選択も兼ねる)とL2正則化(リッジ=係数を小さく抑えるが0にはなりにくい)の混同。
  • 適合率(精度)と再現率の取り違え、および混同行列の読み方。

この章の関連用語

この分野の問題で扱う用語です。意味があいまいなものは、用語集で定義を確認できます。

この章に関連する比較記事

混同しやすい2つの概念を並べて整理した記事です。

よくある質問

Q大項目3 機械学習の概要は何問収録されていますか?

A

現在49問を収録しています。内訳は基礎9問・標準19問・応用21問です。

Q大項目3 機械学習の概要の頻出論点は何ですか?

A

機械学習の種類・代表的な手法・モデルの評価と過学習・前処理とハイパーパラメータなどが出題対象です(当サイト収録問題に基づく編集部集計)。

Q間違えた問題はどう復習すればいいですか?

A

誤答した選択肢のどこがずれていたかを解説で確認し、関連用語がある場合は用語集で定義に戻ってから再演習することをおすすめします。

1 ・ 機械学習の種類

エージェントが環境と試行錯誤しながら行動し、得られる報酬の総和が最大になるような方策を獲得していく学習の枠組みはどれか。

  • 教師あり学習
  • 強化学習
  • アンサンブル学習
  • 教師なし学習
答えと解説を見る
強化学習正解
解説

正解は「強化学習」である。報酬を手がかりに試行錯誤して方策を学ぶのは強化学習。教師あり学習は正解ラベル付きデータから入出力関係を学ぶもので報酬の概念はない。教師なし学習はラベルなしデータの構造抽出が目的。アンサンブル学習は複数のモデルを組み合わせて精度を高める手法であり、学習の枠組みそのものではない。設問では「エージェント」「環境」「報酬」「方策」がそろっているため、ラベルの有無よりも行動の結果として報酬を受け取る点を見る。ゲームやロボット制御のように、正解データを先に与えるのではなく、行動後の評価から方針を改善する場面を想像すると判断しやすい。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

2 ・ 機械学習の種類

教師あり学習のうち、住宅価格や気温のように連続した数値そのものを予測することを目的とするタスクはどれか。

  • 次元削減
  • 分類
  • 回帰
  • クラスタリング
答えと解説を見る
回帰正解
解説

正解は「回帰」である。連続値を予測する教師ありタスクは回帰。分類は離散的なカテゴリ(クラス)を予測するタスクで、連続値の予測ではない。クラスタリングはラベルなしデータをグループに分ける教師なしの処理。次元削減は特徴量の数を減らす処理であり、いずれも数値そのものを予測する目的ではない。住宅価格や気温のように大小関係を持つ数値をそのまま出す点が決め手になる。予測結果が「高い/低い」のラベルではなく、金額や温度のような量として出るなら回帰に分類する。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

3 ・ 代表的な手法

異なるクラスのデータ点との間隔(マージン)が最大になるように識別の境界を決定する、教師あり学習の代表的な分類手法はどれか。

  • ナイーブベイズ
  • k近傍法
  • 主成分分析
  • サポートベクターマシン
答えと解説を見る
サポートベクターマシン正解
解説

正解は「サポートベクターマシン」である。マージン最大化によって識別境界を引くのはサポートベクターマシン。k近傍法は近くにある既知データ点の多数決で分類する手法でマージンの概念は用いない。ナイーブベイズは特徴量の条件付き独立を仮定した確率に基づく分類手法。主成分分析は教師なしの次元削減手法であり分類器ではない。「異なるクラスとの間隔を最大にする境界」という表現がSVMの目印になる。近傍の多数決や確率計算ではなく、境界線と余白の取り方を問われている点を重視する。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

4 ・ 代表的な手法

ラベルのないデータを、あらかじめ指定した数のグループに分け、各グループの重心を更新しながら振り分けを繰り返す教師なし学習の手法はどれか。

  • 主成分分析
  • k-means法
  • k近傍法
  • ロジスティック回帰
答えと解説を見る
k-means法正解
解説

正解は「k-means法」である。指定した個数のグループの重心を更新しながらデータを振り分けるのはk-means法。k近傍法は近くの既知ラベルを参照して分類する教師あり手法で、重心更新やグループ生成は行わない。主成分分析は次元削減手法。ロジスティック回帰はラベル付きデータで分類確率を学ぶ教師あり手法であり、いずれも該当しない。設問では「ラベルなし」「指定した数のグループ」「重心更新」の3点がk-means法を示している。k近傍法と名前が似ているが、k-meansは教師なしのクラスタリング、k近傍法は既知ラベルを使う分類手法である。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

5 ・ 代表的な手法

多数の特徴量を持つデータを、情報の損失を抑えつつ分散が最大となる新たな軸へ変換し、より少ない変数で表現する手法はどれか。

  • 線形回帰
  • 決定木
  • 主成分分析
  • ロジスティック回帰
答えと解説を見る
主成分分析正解
解説

正解は「主成分分析」である。分散が最大となる軸へ射影して次元を圧縮するのは主成分分析。線形回帰は説明変数から連続値を予測する手法で次元圧縮が目的ではない。決定木は条件分岐でデータを分割して予測する手法。ロジスティック回帰はクラス分類の確率を出力する手法であり、いずれも変数を減らして表現し直す処理ではない。「分散が最大となる新たな軸」と「少ない変数で表現」がPCAの判断材料になる。予測精度を直接上げるモデル選択ではなく、データ表現を圧縮する前処理・分析手法を問うている。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

6 ・ 代表的な手法

複数の弱い学習器を組み合わせるアンサンブル学習のうち、前の学習器が誤ったデータを重視しながら次の学習器を逐次的に作っていく手法はどれか。

  • 主成分分析
  • バギング
  • ブースティング
  • k近傍法
答えと解説を見る
ブースティング正解
解説

正解は「ブースティング」である。誤りを重視しながら学習器を順番に追加していくのはブースティング。バギングはデータを復元抽出して並列に学習器を作り平均・多数決をとる手法で、逐次的に誤りを補正するものではない。主成分分析は次元削減手法、k近傍法は近傍データによる分類手法であり、どちらもアンサンブルの逐次学習とは無関係。「前の学習器が誤ったデータを重視」「逐次的」がブースティングの手がかりである。アンサンブルの中でも、並列に集約するバギングではなく、弱点を次の学習器へ引き継ぐ順番付きの作り方を選ぶ。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

7 ・ モデルの評価と過学習

訓練データに対しては高い精度を示すのに、未知のテストデータに対する精度が大きく下がってしまい、汎化性能が低い状態を何というか。

  • 正則化
  • 過学習
  • 交差検証
  • 未学習
答えと解説を見る
過学習正解
解説

正解は「過学習」である。訓練データに適合しすぎて未知データへの汎化性能が下がる状態は過学習。未学習は訓練データにも十分適合できず訓練・テストともに精度が低い状態で逆の現象。正則化は過学習を抑えるための手法であって状態の名称ではない。交差検証は汎化性能を見積もる評価手法であり、状態を指す語ではない。訓練データでは高精度なのにテストデータで下がる、という差の出方を見る。学習済みモデルが訓練例を覚え込みすぎて、新しいデータへの対応力を失っている状態と捉える。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

8 ・ モデルの評価と過学習

データを複数のグループに分割し、一部を検証用・残りを訓練用として役割を入れ替えながら学習と評価を繰り返すことで、汎化性能を安定して見積もる手法はどれか。

  • ホールドアウト法
  • 交差検証
  • 混同行列
  • 正則化
答えと解説を見る
交差検証正解
解説

正解は「交差検証」である。分割した各グループの役割を入れ替えて評価を繰り返すのは交差検証。ホールドアウト法はデータを訓練用とテスト用に一度だけ分ける方法で、役割を入れ替えて繰り返すことはしない。混同行列は分類結果を表にまとめた評価ツール。正則化は過学習を抑える手法であり、いずれも評価の繰り返し手順ではない。「分割」「役割を入れ替える」「繰り返す」が交差検証の判断材料になる。一度の分割結果に依存しにくくするため、複数回の評価を平均的に見る手法だと押さえる。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

9 ・ モデルの評価と過学習

二値分類において、適合率(精度)と再現率の調和平均をとり、両者のバランスを一つの数値で表したものはどれか。

  • ROC曲線
  • 正解率
  • F値
  • 混同行列
答えと解説を見る
F値正解
解説

正解は「F値」である。適合率と再現率の調和平均で両者のバランスを表すのはF値。正解率は全体のうち正しく予測できた割合で、適合率と再現率の調和平均ではない。混同行列は予測と実際の対応を整理した表そのもの。ROC曲線は閾値を変えたときの検出性能を描いた曲線であり、調和平均を表す単一の指標ではない。「適合率と再現率の調和平均」という定義がそのままF値を指す。片方だけが高い分類器を過大評価しないため、両者を同時に見る指標として使われる。特に不均衡データでは正解率だけでは性能を読み誤るため、F値が問われやすい。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

10 ・ モデルの評価と過学習

線形回帰のモデルに、各係数の絶対値の和に比例した罰則を加えて学習することで、重要でない特徴量の係数をちょうど0に近づけ、実質的に変数の取捨選択も行えるようにする手法はどれか。

  • ロジスティック回帰
  • L1正則化(ラッソ回帰)
  • 線形回帰
  • L2正則化(リッジ回帰)
答えと解説を見る
L1正則化(ラッソ回帰)正解
解説

正解は「L1正則化(ラッソ回帰)」である。係数の絶対値の和を罰則として加えるため、重要でない特徴量の係数がちょうど0になりやすく、実質的に変数選択も兼ねられる。L2正則化(リッジ回帰)は係数の二乗和を罰則とし、係数を小さく抑えるが完全な0にはなりにくいため、変数選択の効果はL1正則化ほど強くない。線形回帰・ロジスティック回帰は罰則項を持たない素のモデルであり、過剰適合を抑える罰則や係数を0に近づける仕組み自体を持たない。罰則の形が「絶対値の和」か「二乗和」か、係数がちょうど0になるかどうかの2点が判断材料になる。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

11 ・ 前処理とハイパーパラメータ

あらかじめ指定した複数のハイパーパラメータの候補値について、その全ての組み合わせをもれなく試し、最も性能の良い設定を選ぶ手法はどれか。

  • ランダムサーチ
  • グリッドサーチ
  • ホールドアウト法
  • k分割交差検証
答えと解説を見る
グリッドサーチ正解
解説

正解は「グリッドサーチ」である。指定したハイパーパラメータの候補値をすべて組み合わせて総当たりで試し、最も性能の良い設定を選ぶ。ランダムサーチは候補の範囲から無作為に組み合わせを選んで試すため、全組み合わせを網羅しない点でグリッドサーチと異なる。ホールドアウト法・k分割交差検証はモデルの汎化性能を見積もる評価手続きであり、ハイパーパラメータの組み合わせを探す探索手法ではない。「もれなく」「全ての組み合わせ」という総当たりの条件がグリッドサーチの決め手になる。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

12 ・ 前処理とハイパーパラメータ

クラスタリングで適切なクラスタ数を決める際、クラスタ数を増やしながらクラスタ内のばらつき(誤差)の値を見て、その減少のしかたが急に緩やかになる変化点を、ちょうどよいクラスタ数の目安とする手法はどれか。

  • 主成分分析(PCA)
  • k-means法
  • シルエット分析
  • エルボー法
答えと解説を見る
エルボー法正解
解説

正解は「エルボー法」である。クラスタ数を増やしながらクラスタ内のばらつき(誤差)の減少を確認し、その減り方が急に緩やかになる折れ曲がり点を適切なクラスタ数の目安とする。シルエット分析は各データ点が自分のクラスタにどれだけまとまっているかを指標化して比較する別の手法であり、誤差の折れ曲がりを見るものではない。k-means法はクラスタリングそのものを行うアルゴリズムであってクラスタ数を決める手法ではなく、主成分分析(PCA)は次元削減の手法であり、いずれもクラスタ数の目安を出す方法ではない。「誤差の減少が緩やかになる変化点」という表現がエルボー法の目印になる。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

13 ・ 代表的な手法

線形回帰の考え方を分類に応用し、出力を0〜1の値(確率)に変換することで、主に二値分類に用いられる手法はどれか。

  • 主成分分析
  • k-means法
  • ロジスティック回帰
  • 階層的クラスタリング
答えと解説を見る
ロジスティック回帰正解
解説

正解は「ロジスティック回帰」である。線形回帰の考え方を分類に応用し、出力をシグモイド関数で0〜1の値(確率)に変換することで、主に二値分類に用いられる教師あり学習の手法である。主成分分析は特徴量を分散の大きい軸へ変換する次元削減の手法であり分類器ではない。k-means法と階層的クラスタリングはいずれもラベルのないデータをグループ分けする教師なし学習であり、確率を出力して二値分類を行う手法ではない。「出力を確率に変換」「主に二値分類」という条件がロジスティック回帰の目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

14 ・ 代表的な手法

多数の決定木を作り、それぞれの予測の多数決や平均によって最終的な予測を行うアンサンブル学習の手法はどれか。

  • サポートベクターマシン
  • 線形回帰
  • ランダムフォレスト
  • 主成分分析
答えと解説を見る
ランダムフォレスト正解
解説

正解は「ランダムフォレスト」である。データや特徴量をランダムに選んで多数の決定木を作り、それぞれの予測を多数決(分類)や平均(回帰)で統合するアンサンブル学習(バギングの代表例)の手法である。サポートベクターマシンはクラス間のマージンを最大化する境界を1つ学習する手法であり、複数の決定木を組み合わせるものではない。線形回帰は説明変数から連続値を予測する単一のモデル、主成分分析は次元削減の手法であり、いずれも決定木を多数作って統合する仕組みを持たない。「多数の決定木」「多数決や平均で統合」という条件がランダムフォレストの目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

15 ・ モデルの評価と過学習

分類モデルの評価で、予測した結果と実際の正解の組み合わせ(真陽性・偽陽性・偽陰性・真陰性)を表の形にまとめ、適合率や再現率を求めるもとになるものはどれか。

  • 散布図
  • ヒストグラム
  • 混同行列
  • 決定木
答えと解説を見る
混同行列正解
解説

正解は「混同行列」である。分類モデルの予測結果と実際の正解の組み合わせ(真陽性・偽陽性・偽陰性・真陰性)を表の形にまとめたもので、適合率(精度)や再現率、正解率などを計算するもとになる。散布図は2変数の関係を点で示す可視化、ヒストグラムはデータの分布を棒状に示す可視化であり、いずれも予測と正解の組み合わせを集計する表ではない。決定木は分類を行う手法自体であり、分類結果の内訳をまとめる評価の表ではない。「真陽性・偽陽性・偽陰性・真陰性」「適合率や再現率を求めるもと」という条件が混同行列の目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

16 ・ 機械学習の種類

教師あり学習のタスクのうち、データがどのカテゴリ(クラス)に属するかを予測することを目的とするものはどれか。

  • 回帰
  • クラスタリング
  • 次元削減
  • 分類
答えと解説を見る
分類正解
解説

正解は「分類」である。分類は、教師あり学習のうち、データがどのカテゴリ(クラス)に属するかを予測することを目的とするタスクである(例:メールが迷惑メールか否か)。回帰は連続した数値そのものを予測するタスクであり、カテゴリ名を出す分類とは出力の形が異なる。クラスタリングと次元削減はいずれも教師なし学習に分類され、正解ラベルを使ってカテゴリを予測するタスクではない。「どのカテゴリ(クラス)に属するかを予測するか」という条件が、連続値を出す回帰との分かれ目であり分類の目印になる。

https://www.jdla.org/certificate/general/

17 ・ 前処理とハイパーパラメータ

年齢・年収・購入回数のように単位や値の範囲が大きく異なる数値特徴量を、そのまま距離に基づく機械学習手法に入れると一部の特徴量が過度に効きやすい。この対策として最も適切な前処理はどれか。

  • オーバーサンプリングで少数派データを増やす
  • グリッドサーチで全ての特徴量を削除する
  • 正規化や標準化で特徴量のスケールをそろえる
  • エルボー法で欠損値を補完する
答えと解説を見る
正規化や標準化で特徴量のスケールをそろえる正解
解説

正解は「正規化や標準化で特徴量のスケールをそろえる」である。年齢・年収・購入回数のように単位や値の範囲が大きく異なる数値特徴量を距離に基づく手法にそのまま入れると、値の大きい特徴量(例えば年収)の影響が距離計算で強くなりすぎる。正規化や標準化は、各特徴量の値を共通の範囲や分布に変換し、この偏りを解消する前処理である。オーバーサンプリングは少数派クラスの件数を増やしてクラス比率を調整する処理であり、特徴量ごとの値の範囲を揃えるものではない。グリッドサーチはハイパーパラメータの候補を網羅的に試す探索方法であり、特徴量を削除する処理ではなく、選択肢自体が矛盾した組み合わせになっている。エルボー法はクラスタリングで適切なクラスタ数を検討する手法であり、欠損値の補完とは無関係である。

https://www.jdla.org/certificate/general/

18 ・ 代表的な手法

顧客の属性や行動を条件として順に分岐させ、最終的に購入する・しないなどの予測を行う。分岐の根拠を木の形で確認しやすい代表的な機械学習手法はどれか。

  • 主成分分析(PCA)
  • 決定木
  • k-means法
  • 標準化
答えと解説を見る
決定木正解
解説

正解は「決定木」である。決定木は、顧客の属性や行動といった条件を根から葉へ順にたどりながら購入する・しないを予測する手法であり、選ぶ際の判断軸は、モデルの中身を木構造として人間が追えるかという解釈のしやすさにある。決定木を複数組み合わせて精度を高めるランダムフォレストのようなアンサンブル学習では、個々の木が持つこの追いやすさが失われ、どの条件が予測に効いているかを外から確認しにくくなる。主成分分析(PCA)・k-means法・標準化はいずれも、次元削減・クラスタリング・前処理という別の役割を担う手法であり、条件分岐の過程を木の形で確認できるという性質を共有しない。

https://www.jdla.org/certificate/general/

19 ・ 前処理とハイパーパラメータ

不正利用の検知のように、正例が極端に少ない不均衡データで分類モデルを学習する。少数派の例を複製または生成して学習データ内の比率を調整する対策はどれか。

  • アンダーサンプリング
  • グリッドサーチ
  • オーバーサンプリング
  • ワンホットエンコーディング
答えと解説を見る
オーバーサンプリング正解
解説

正解は「オーバーサンプリング」である。オーバーサンプリングは、少数派クラスのデータを複製または生成して増やし、クラス間の偏りを緩和する対策である。判断の軸は、少数派を「増やす」処理か、多数派を「減らす」処理か、あるいは全く別の目的(パラメータ探索・カテゴリ表現)を持つ処理かという違いである。アンダーサンプリングは増減の方向が逆(多数派を減らす)、グリッドサーチはハイパーパラメータ探索、ワンホットエンコーディングはカテゴリの表現方法であり、いずれも少数派を増やす処理ではない。

https://www.jdla.org/certificate/general/

20 ・ モデルの評価と過学習

二値分類モデルについて、判定のしきい値をさまざまに変えたときの真陽性率と偽陽性率の関係を曲線で表し、モデルの識別性能を評価する方法はどれか。

  • k分割交差検証
  • L2正則化(リッジ回帰)
  • ホールドアウト法
  • ROC曲線とAUC
答えと解説を見る
ROC曲線とAUC正解
解説

正解は「ROC曲線とAUC」である。モデルの評価と過学習の範囲には、正解率や適合率・再現率・F値のように、しきい値を1つに固定した時点の性能を数値化する指標と、しきい値を動かしながら性能の変わり方そのものを追う指標が並ぶ。この設問が問うのは後者であり、判定のしきい値をさまざまに動かしたときに真陽性率と偽陽性率がどう変化するかを曲線として描き、曲線の下の面積であるAUCへ1つの数値としてまとめられるかどうかが選ぶ際の分かれ目になる。他の選択肢はいずれも、データを訓練用と検証用にどう分けるかという分割の手続き(k分割交差検証・ホールドアウト法)か、学習時に重みへ制約を課して過学習を抑える工夫(L2正則化)であり、しきい値を動かした識別性能の変化を曲線として捉える視点を持たない。

https://www.jdla.org/certificate/general/

21 ・ 機械学習の種類

住宅の面積や築年数から価格のような連続値を予測する問題は、教師あり学習の中ではどの種類に当たるか。

  • 分類
  • クラスタリング
  • 強化学習
  • 回帰
答えと解説を見る
回帰正解
解説

教師あり学習の内部で回帰と分類を分ける決め手は、出力が連続値か離散的なカテゴリかという一点にある。住宅の面積や築年数から価格という大小関係を持つ数値を求める設問では、この軸に沿って回帰を選ぶのが基本である。他の3つの選択肢は、カテゴリへの割り当てを行うか、正解ラベルを使わずにグループを作るか、報酬をもとに方策を改善するかのいずれかであり、いずれも「連続値そのものを直接推定する」という問題文の要求とは出力の形が異なるため、まとめて外れる。

https://www.jdla.org/certificate/general/

22 ・ 機械学習の種類

メールを迷惑メールか通常メールかに分けるように、入力データをあらかじめ決められたカテゴリへ割り当てる問題はどれか。

  • 分類
  • 回帰
  • 次元削減
  • 強化学習
答えと解説を見る
分類正解
解説

分類と回帰はどちらも教師あり学習に属するが、出力が離散的なカテゴリか連続値かで役割が分かれる。迷惑メールか通常メールかを判定するように、あらかじめ決められた選択肢の中から1つを当てる設問では分類を選ぶのが判断軸になる。次元削減は特徴量の数を圧縮する前処理寄りの技術であり、強化学習は報酬を手がかりに行動を改善する枠組みであるため、いずれも「カテゴリを直接判定する」という問題文の目的そのものとはそもそも扱う対象や手がかりが異なる点で足並みがそろわない。

https://www.jdla.org/certificate/general/

23 ・ モデルの評価と過学習

データを複数の部分に分け、各部分を順番に検証用として使いながらモデル性能を評価する方法はどれか。

  • k分割交差検証
  • L1正則化(ラッソ回帰)
  • 混同行列
  • 学習曲線
答えと解説を見る
k分割交差検証正解
解説

k分割交差検証が他の3つと質的に違うのは、モデルを評価するための手続きそのものを指す語である点にある。L1正則化は学習時にモデルへ課す制約、混同行列は分類結果を事後的に集計した表、学習曲線は学習の進み具合を可視化した図であり、いずれも学習の結果や過程を表す語であって、データを分割しながら繰り返し検証するという評価の手続きそのものを説明した語ではない。限られたデータを無駄なく評価に使いたいときに、分割と評価を順番に繰り返す方法として選ぶのがk分割交差検証であり、他の3つのように学習や結果の記述にとどまる語とは役割の位置づけが異なる。

https://www.jdla.org/certificate/general/

24 ・ 前処理とハイパーパラメータ

色が赤・青・緑のようなカテゴリ変数を、機械学習モデルで扱いやすい0/1の列に変換する前処理はどれか。

  • ワンホットエンコーディング
  • 標準化
  • アンダーサンプリング
  • ランダムサーチ
答えと解説を見る
ワンホットエンコーディング正解
解説

この設問の分かれ目は、前処理の対象が変数の型なのか数値の尺度なのかクラスの比率なのか探索対象の設定値なのかという点にある。色のような文字列で表されたカテゴリを、モデルが直接扱える0/1の数値列へ作り替える処理はワンホットエンコーディングに限られる。標準化は数値の尺度をそろえる処理、アンダーサンプリングはクラスの偏りを是正する処理、ランダムサーチはモデル本体ではなく学習の設定値を探す処理であり、いずれも対象がカテゴリ変数の型変換ではない点で共通して外れる。

https://www.jdla.org/certificate/general/

25 ・ 代表的な手法

複数の決定木を組み合わせ、各木の予測を集約して分類や回帰の性能を高めるアンサンブル手法はどれか。

  • ランダムフォレスト
  • k近傍法(k-NN)
  • 主成分分析(PCA)
  • ロジスティック回帰
答えと解説を見る
ランダムフォレスト正解
解説

この設問を見分ける軸は、複数のモデルの予測を集約する仕組みを持つかどうかである。ランダムフォレストは、決定木をそれぞれ異なるデータや特徴量の一部から複数作り、それらの予測を集約するアンサンブル学習の考え方に立つ手法である。k近傍法は近いデータを参照するだけの単一の判定方法、主成分分析は特徴量を圧縮する前処理、ロジスティック回帰は線形結合を確率に変換する単一モデルであり、いずれも複数のモデルを組み合わせて集約する構造を持たない点で、ランダムフォレストとは仕組みが異なる。

https://www.jdla.org/certificate/general/

26 ・ モデルの評価と過学習

分類モデルの結果を、真陽性・偽陽性・偽陰性・真陰性のように整理する表はどれか。

  • 混同行列
  • ROC曲線
  • 学習曲線
  • ホールドアウト法
答えと解説を見る
混同行列正解
解説

混同行列を他の3つと分けるのは、それが予測結果を4つの区分に整理した表である点である。ROC曲線はしきい値を動かしながら性能の変化を描いた曲線、学習曲線は学習の進み具合に対する誤差の変化を描いた曲線であり、どちらも表ではなくグラフの形をとる。ホールドアウト法はそもそも評価の結果を示すものではなく、データを訓練用とテスト用に分ける手順を指す語である。予測結果を真陽性・偽陽性・偽陰性・真陰性の4区分へ突き合わせて示す表という条件に合うのは混同行列だけである。

https://www.jdla.org/certificate/general/

27 ・ 機械学習の種類

正解ラベルを使わず、データ同士の近さや似た構造にもとづいてグループを見つける学習はどれか。

  • 教師なし学習
  • 教師あり学習
  • 強化学習
  • 回帰
答えと解説を見る
教師なし学習正解
解説

この設問の判断軸は、学習の手がかりとして正解ラベルを使うかどうかである。教師なし学習は正解ラベルを使わず、データ同士の近さや構造だけを手がかりにグループを見つける点で、他の3つと立場が異なる。教師あり学習と回帰はいずれも正解ラベルを前提とする枠組みであり、回帰はその中で連続値を予測する具体例にすぎない。強化学習も、報酬という別の手がかりを使う点で、正解ラベルなしにデータの構造だけからグループを見つける処理とは前提が異なる。この違いに照らすと、正解ラベルを使わない教師なし学習だけが問題文の条件に当てはまる。

https://www.jdla.org/certificate/general/

28 ・ 前処理とハイパーパラメータ

ハイパーパラメータの候補値を格子状に用意し、すべての組み合わせを試して良い設定を探す方法はどれか。

  • グリッドサーチ
  • ランダムサーチ
  • エルボー法
  • シルエット分析
答えと解説を見る
グリッドサーチ正解
解説

正解は「グリッドサーチ」である。グリッドサーチは、事前に用意した候補値のすべての組み合わせを試すハイパーパラメータ探索方法である。ランダムサーチは候補をランダムに試す。エルボー法とシルエット分析はクラスタリングのクラスタ数や結果の検討で使われる。 ハイパーパラメータ探索では、候補の選び方を見分ける。用意した値の直積を漏れなく試すならグリッドサーチ、無作為に候補を試すならランダムサーチであり、クラスタ数やクラスタリング結果を調べる手法は目的が異なる。

https://www.jdla.org/certificate/general/

29 ・ モデルの評価と過学習

モデルが単純すぎることで生じる系統的な誤差と、訓練データのわずかな違いに敏感に反応することで生じる誤差の、トレードオフの関係にある2つの誤差要因をまとめて何と呼ぶか。

  • L1正則化とL2正則化
  • 適合率と再現率
  • 訓練データとテストデータ
  • バイアスとバリアンス
答えと解説を見る
バイアスとバリアンス正解
解説

正解はバイアスとバリアンス。バイアスはモデルが単純すぎて真の関係を捉えきれないことによる誤差、バリアンスは訓練データの偏りに過敏に反応してばらつく誤差を指し、両者は一方を下げると他方が上がりやすいトレードオフの関係にある。適合率と再現率は分類性能の指標の組、訓練データとテストデータは学習と評価に用いるデータの区分、L1・L2正則化は過学習を抑える手法で、いずれも誤差を2要因に分解するこの概念とは異なる。 判断では、手法・評価指標・データ区分ではなく、誤差を生む二つの要因を探す。単純すぎて関係を捉えない側がバイアス、訓練データの違いへ敏感な側がバリアンスであり、この二つのトレードオフが設問の対象である。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

30 ・ モデルの評価と過学習

2値分類器で、識別のしきい値を変えながら描いたROC曲線の下側の面積として求められ、値が1に近いほど性能が高いとされる評価指標はどれか。

  • AUC
  • F値
  • 正解率
  • 混同行列
答えと解説を見る
AUC正解
解説

AUCが他の3つと違うのは、しきい値を1つに固定せずに評価できる点にある。F値と正解率はどちらも、ある1つのしきい値で分類した結果から求まる単発の数値であり、しきい値を変えたときの挙動全体までは表さない。混同行列も特定のしきい値における予測と実際の組み合わせを整理した表にとどまる。AUCはしきい値を動かしながら描いたROC曲線の下側の面積として求まるため、しきい値の選び方に左右されにくいモデル全体の識別性能を1つの数値で表せる指標として使われる。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

31 ・ 代表的な手法

多数の弱い学習器を一つずつ順番に作り、前の学習器が残した誤差を次の学習器が勾配降下の考え方で補正していくアンサンブル学習の手法はどれか。

  • バギング
  • 勾配ブースティング
  • ランダムフォレスト
  • k近傍法
答えと解説を見る
勾配ブースティング正解
解説

この設問を分けるのは、複数の学習器を並列に独立して作るか、それとも前の学習器の結果を踏まえて逐次的に作るかという軸である。バギングとランダムフォレストはどちらも学習器を互いに独立させて並列に作り、その予測を多数決や平均でまとめる立場をとる。k近傍法はそもそも複数の学習器を組み合わせる仕組みを持たない単一の判定方法である。勾配ブースティングだけが、前の学習器が残した誤差を次の学習器が勾配降下の考え方で順番に補正していくという逐次的な仕組みを持つ。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

32 ・ 前処理とハイパーパラメータ

訓練データの量や学習の反復回数を横軸に、訓練データと検証データに対する性能(誤差)の推移を縦軸にとって描き、過学習や未学習の傾向を診断するのに使うグラフはどれか。

  • 混同行列
  • ROC曲線
  • エルボー法
  • 学習曲線
答えと解説を見る
学習曲線正解
解説

この設問を分ける軸は、グラフの横軸に何をとるかである。学習曲線は訓練データの量や学習の反復回数を横軸に置き、訓練誤差と検証誤差の開き方から過学習や未学習を診断する。ROC曲線の横軸は判定のしきい値に関わる指標であり、データ量や反復回数ではない。混同行列はそもそもグラフではなく予測結果を整理した表であり、エルボー法はクラスタリングで適切なクラスタ数を検討する手法であって、どちらもデータ量や反復回数に対する誤差の推移を描くものではない。この横軸の違いに着目すると、条件に合うグラフは学習曲線だけに絞られる。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

33 ・ 機械学習の種類

あらかじめ正解(ラベル)が与えられたデータを用いて、入力と正解の対応関係を学習する機械学習の枠組みはどれか。

  • 教師なし学習
  • 強化学習
  • 半教師あり学習
  • 教師あり学習
答えと解説を見る
教師あり学習正解
解説

正解は「教師あり学習」である。あらかじめ正解(ラベル)が与えられたデータを用いて、入力と正解の対応関係を学習する枠組みで、分類や回帰に用いられる。教師なし学習は正解のないデータから構造を見つける枠組みであり、正解ラベルを対応づける学習ではない。強化学習は報酬を手がかりに試行錯誤しながら方策を学ぶ枠組みであり、あらかじめ与えられた正解ラベルを使う仕組みとは異なる。半教師あり学習は少量のラベル付きデータと大量のラベルなしデータを組み合わせる枠組みであり、設問の「あらかじめ正解が与えられたデータ」だけを使う条件とはずれる。「あらかじめ正解(ラベル)が与えられた」「入力と正解の対応関係を学習」という条件が教師あり学習の目印になる。

https://www.jdla.org/certificate/general/

34 ・ 機械学習の種類

正解ラベルが与えられていないデータから、データに潜む構造やまとまりを自動的に見つけ出すことを目的とする学習の枠組みはどれか。

  • 教師あり学習
  • 強化学習
  • 深層強化学習
  • 教師なし学習
答えと解説を見る
教師なし学習正解
解説

正解は「教師なし学習」である。教師なし学習は、正解ラベルが与えられていないデータから、データに潜む構造やまとまり(クラスタなど)を自動的に見つけ出すことを目的とする学習の枠組みである。教師あり学習は、入力データと正解ラベルの対応関係を学ぶ枠組みであり、正解ラベルを使わずに構造を見つけ出すという条件とは逆になる。強化学習は、報酬を手がかりに方策を学ぶ枠組みであり、データの構造やまとまりを抽出することを目的とはしない。深層強化学習も、報酬の最大化を目指す強化学習の一種であることに変わりはなく、教師なし学習の定義には当てはまらない。

https://www.jdla.org/certificate/general/ (大項目3 機械学習の概要)

35 ・ 機械学習の種類

強化学習で、方策を表す要素と価値関数を推定する要素を分け、後者の評価を使って前者の方策を更新する枠組みはどれか。

  • Actor-Critic
  • 方策勾配法
  • DQN
  • k-means法
答えと解説を見る
Actor-Critic正解
解説

正解は「Actor-Critic」である。強化学習の枠組みは、方策そのもののパラメータを直接更新していく方策ベースの発想と、状態や行動の価値を推定してから行動を選ぶ価値ベースの発想に大きく分けられる。Actor-Criticは、方策を受け持つActorと価値の推定を受け持つCriticを分けて持つことでこの2つの発想を組み合わせた枠組みという位置づけにあり、Criticが下す評価を使ってActorの方策を更新する点が設問の条件と一致する。他の選択肢はいずれも方策ベース・価値ベースの一方に立つか、報酬や方策そのものを扱わない教師なし学習であり、ActorとCriticを分けて評価と更新を連携させる構成を持たない。

https://papers.nips.cc/paper/1999/hash/464d828b85b0bed98e80ade0a5c43b0f-Abstract.html

36 ・ 代表的な手法

顧客が解約する確率を0から1で出力し、しきい値で解約・継続の2群へ分類した。用いた手法はどれか。

  • 主成分分析
  • k-means法
  • ロジスティック回帰
  • 階層的クラスタリング
答えと解説を見る
ロジスティック回帰正解
解説

この事例では「確率を出力して二値分類へ利用する回帰手法か」を確認すると、ロジスティック回帰に絞れる。正解は「ロジスティック回帰」である。線形回帰の考え方を分類に応用し、出力をシグモイド関数で0〜1の値(確率)に変換することで、主に二値分類に用いられる教師あり学習の手法である。主成分分析は特徴量を分散の大きい軸へ変換する次元削減の手法であり分類器ではない。k-means法と階層的クラスタリングはいずれもラベルのないデータをグループ分けする教師なし学習であり、確率を出力して二値分類を行う手法ではない。「出力を確率に変換」「主に二値分類」という条件がロジスティック回帰の目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

37 ・ 代表的な手法

異なる標本で学習した多数の決定木の多数決により、最終的な分類を決める。この手法はどれか。

  • サポートベクターマシン
  • 線形回帰
  • ランダムフォレスト
  • 主成分分析
答えと解説を見る
ランダムフォレスト正解
解説

この事例では「複数の決定木を並列に作り多数決や平均を取るか」を確認すると、ランダムフォレストに絞れる。正解は「ランダムフォレスト」である。データや特徴量をランダムに選んで多数の決定木を作り、それぞれの予測を多数決(分類)や平均(回帰)で統合するアンサンブル学習(バギングの代表例)の手法である。サポートベクターマシンはクラス間のマージンを最大化する境界を1つ学習する手法であり、複数の決定木を組み合わせるものではない。線形回帰は説明変数から連続値を予測する単一のモデル、主成分分析は次元削減の手法であり、いずれも決定木を多数作って統合する仕組みを持たない。「多数の決定木」「多数決や平均で統合」という条件がランダムフォレストの目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

38 ・ モデルの評価と過学習

疾病分類器について真陽性・偽陽性・偽陰性・真陰性を整理し、適合率と再現率を計算したい。基礎となる表はどれか。

  • 散布図
  • ヒストグラム
  • 混同行列
  • 決定木
答えと解説を見る
混同行列正解
解説

この事例では「実際と予測の組合せを4区分で集計する表か」を確認すると、混同行列に絞れる。正解は「混同行列」である。分類モデルの予測結果と実際の正解の組み合わせ(真陽性・偽陽性・偽陰性・真陰性)を表の形にまとめたもので、適合率(精度)や再現率、正解率などを計算するもとになる。散布図は2変数の関係を点で示す可視化、ヒストグラムはデータの分布を棒状に示す可視化であり、いずれも予測と正解の組み合わせを集計する表ではない。決定木は分類を行う手法自体であり、分類結果の内訳をまとめる評価の表ではない。「真陽性・偽陽性・偽陰性・真陰性」「適合率や再現率を求めるもと」という条件が混同行列の目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

39 ・ 代表的な手法

融資申込が延滞へ至る確率を推定し、一定値以上を要確認に分類する手法はどれか。

  • 主成分分析
  • k-means法
  • ロジスティック回帰
  • 階層的クラスタリング
答えと解説を見る
ロジスティック回帰正解
解説

この事例では「0から1の確率を用いた二値分類か」を確認すると、ロジスティック回帰に絞れる。正解は「ロジスティック回帰」である。線形回帰の考え方を分類に応用し、出力をシグモイド関数で0〜1の値(確率)に変換することで、主に二値分類に用いられる教師あり学習の手法である。主成分分析は特徴量を分散の大きい軸へ変換する次元削減の手法であり分類器ではない。k-means法と階層的クラスタリングはいずれもラベルのないデータをグループ分けする教師なし学習であり、確率を出力して二値分類を行う手法ではない。「出力を確率に変換」「主に二値分類」という条件がロジスティック回帰の目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

40 ・ 代表的な手法

多数の決定木へ異なる学習標本を与え、その平均予測で需要を推定する手法はどれか。

  • サポートベクターマシン
  • 線形回帰
  • ランダムフォレスト
  • 主成分分析
答えと解説を見る
ランダムフォレスト正解
解説

この事例では「決定木の集合による平均や多数決か」を確認すると、ランダムフォレストに絞れる。正解は「ランダムフォレスト」である。データや特徴量をランダムに選んで多数の決定木を作り、それぞれの予測を多数決(分類)や平均(回帰)で統合するアンサンブル学習(バギングの代表例)の手法である。サポートベクターマシンはクラス間のマージンを最大化する境界を1つ学習する手法であり、複数の決定木を組み合わせるものではない。線形回帰は説明変数から連続値を予測する単一のモデル、主成分分析は次元削減の手法であり、いずれも決定木を多数作って統合する仕組みを持たない。「多数の決定木」「多数決や平均で統合」という条件がランダムフォレストの目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

41 ・ モデルの評価と過学習

不正検知モデルで見逃しと誤検知を分けて評価するため、実際の状態と予測結果を交差させた表を作る。この表はどれか。

  • 散布図
  • ヒストグラム
  • 混同行列
  • 決定木
答えと解説を見る
混同行列正解
解説

この事例では「真偽と陽性陰性の組合せを整理するか」を確認すると、混同行列に絞れる。正解は「混同行列」である。分類モデルの予測結果と実際の正解の組み合わせ(真陽性・偽陽性・偽陰性・真陰性)を表の形にまとめたもので、適合率(精度)や再現率、正解率などを計算するもとになる。散布図は2変数の関係を点で示す可視化、ヒストグラムはデータの分布を棒状に示す可視化であり、いずれも予測と正解の組み合わせを集計する表ではない。決定木は分類を行う手法自体であり、分類結果の内訳をまとめる評価の表ではない。「真陽性・偽陽性・偽陰性・真陰性」「適合率や再現率を求めるもと」という条件が混同行列の目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

42 ・ 代表的な手法

広告をクリックする確率を推定し、しきい値以上を配信候補とする二値分類手法はどれか。

  • 主成分分析
  • k-means法
  • ロジスティック回帰
  • 階層的クラスタリング
答えと解説を見る
ロジスティック回帰正解
解説

この事例では「確率出力を二群の分類へ使うか」を確認すると、ロジスティック回帰に絞れる。正解は「ロジスティック回帰」である。線形回帰の考え方を分類に応用し、出力をシグモイド関数で0〜1の値(確率)に変換することで、主に二値分類に用いられる教師あり学習の手法である。主成分分析は特徴量を分散の大きい軸へ変換する次元削減の手法であり分類器ではない。k-means法と階層的クラスタリングはいずれもラベルのないデータをグループ分けする教師なし学習であり、確率を出力して二値分類を行う手法ではない。「出力を確率に変換」「主に二値分類」という条件がロジスティック回帰の目印になる。

https://www.jdla.org/certificate/general/ / G検定シラバス2024(第1.4版・2026-07-05照合)

このページは表示速度を保つため最初の42問を掲載しています。43問以降を読む →49問は演習画面でも解けます。

執筆: ミナト編集部運営者情報を見る