DS検定 第5章 データ準備・可視化技法とモデル化 予想問題と解説
DS検定「第5章 データ準備・可視化技法とモデル化」の予想問題を47問収録しています。このページでは代表42問を解説つきで掲載し、全問は演習画面で解けます。公式シラバスの範囲で作成しています。
この章の要点
データ準備・モデル化・評価・非構造化データ処理などを扱う分野です。全47問(基礎5問・標準16問・応用26問)を収録しています。
- データ準備
- モデル化・評価
- 非構造化データ処理
情報源と編集区分
公式範囲を確認し、問題数・難易度・確認点は当サイトが集計・編集。 一次情報確認日: 2026-07-12。
試験概要(公式)確認しておきたいポイント
当サイトの作問時に観察した、取り違えやすい論点です(公式の統計ではありません)。
- 標本誤差とサンプリングバイアスの混同。標本誤差は標本抽出に伴う偶然のばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差。
- 過学習を『精度が高いこと』と誤解する。訓練データに過剰適合し未知データへの汎化性能が下がる問題として理解する必要がある。
- Precision(適合率)とRecall(再現率)の取り違え。目的(見逃しを減らしたいか、誤検知を減らしたいか)によって重視する指標が変わる。
この章の関連用語
この分野の問題で扱う用語です。意味があいまいなものは、用語集で定義を確認できます。
よくある質問
Q第5章 データ準備・可視化技法とモデル化は何問収録されていますか?
現在47問を収録しています。内訳は基礎5問・標準16問・応用26問です。
Q第5章 データ準備・可視化技法とモデル化の頻出論点は何ですか?
データ準備・モデル化・評価・非構造化データ処理などが出題対象です(当サイト収録問題に基づく編集部集計)。
Q間違えた問題はどう復習すればいいですか?
誤答した選択肢のどこがずれていたかを解説で確認し、関連用語がある場合は用語集で定義に戻ってから再演習することをおすすめします。
標本誤差とサンプリングバイアスの違いについて、最も適切な説明はどれか。
答えと解説を見る
正解は「標本誤差は偶然生じるばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差」である。標本誤差は標本を取る以上避けにくい偶然のずれだが、サンプリングバイアスは集め方が偏っていることで生じる。標本サイズを増やしても、抽出方法が偏ったままだとバイアスは残る。設問では二つの用語を、偶然のばらつきか抽出方法の偏りかで対応付ける。定義を逆にした選択肢、同じ意味とする選択肢、標本サイズだけで必ず解消するとする選択肢を明確に除外する。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
訓練データに過剰に適合し、未知のデータへの予測性能が下がってしまう現象の名称として正しいものはどれか。
答えと解説を見る
正解は「過学習」である。過学習は、訓練データの細かな癖やノイズまで覚えてしまい、未知データに対する汎化性能が下がる現象を指す。「標準化」は変数ごとに異なる数値のスケールをそろえる前処理であり、現象の名称ではない。「交差検証」はデータを複数に分割してモデルの性能を評価する方法であり、過学習が起きていないかを確認する手段ではあっても、現象そのものの名称ではない。「次元の呪い」は特徴量の次元数が増えることでデータが疎になり学習や距離の計算が難しくなる別の問題であり、訓練データへの過剰な適合を原因とする過学習とは発生要因が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
分類モデルの精度評価で、実際に病気である人のうち正しく陽性と判定できた割合を表す指標として正しいものはどれか。
答えと解説を見る
正解は「Recall(再現率)」である。Recallは、実際に陽性であるデータのうち、モデルが正しく陽性と判定できた割合を表す。病気の見逃しを減らしたい場面では、陽性者をどれだけ拾えたかが重要になる。これに対して「Precision(適合率)」は、モデルが陽性と判定した中で実際に陽性だった割合を表し、割合の分母が「実際の陽性者数」か「陽性と判定した数」かでRecallとは異なる。「RMSE」と「決定係数」はいずれも回帰モデルの評価指標であり、予測値と実測値のずれの大きさや目的変数のばらつきの説明度を表すもので、陽性・陰性の分類結果の割合を表す指標ではない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
「教師あり学習」と「教師なし学習」の違いとして最も適切な説明はどれか。
答えと解説を見る
正解は「教師あり学習は正解データ(ラベル)を用い、教師なし学習は用いない」である。教師あり学習は入力と正解ラベルの対応関係から学習し、単回帰分析や重回帰分析のような回帰、ロジスティック回帰分析のような分類のいずれも扱う。教師なし学習はラベルを用いず、クラスター分析のようにデータの構造やまとまりを見つける。「教師あり学習は必ず回帰、教師なし学習は必ず分類を行う」は、教師あり学習にロジスティック回帰分析のような分類も含まれる点を無視している。「教師あり学習と教師なし学習に違いはない」は、正解ラベルを使うかどうかという最も基本的な違いを否定してしまっている。「教師なし学習の方が必ず精度が高い」は、正解ラベルなしで学習する教師なし学習と、ラベルを使って学習する教師あり学習の精度を単純に比較できるという前提が誤りである。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
決定木をベースとしたアンサンブル学習の手法として当てはまらないものはどれか。
答えと解説を見る
正解は「ホールドアウト法」である。Random Forestは複数の決定木の多数決・平均を取る手法、XGBoostとLightGBMは決定木を順に追加していく勾配ブースティング(GBDT)の実装であり、いずれも決定木を組み合わせて予測精度を高めるアンサンブル学習の手法である。ホールドアウト法はデータを学習用と評価用に分割してモデルの性能を検証する手法であり、決定木を組み合わせて予測するアンサンブル学習の手法ではない。3つが「複数の決定木をどう組み合わせて予測するか」という同じ問いに答える手法である一方、ホールドアウト法は「学習したモデルをどう評価するか」という別の問いに答える手法であり、単独で異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
自然言語処理において、文章から主語・述語などの関係を解析する処理として正しいものはどれか。
答えと解説を見る
正解は「係り受け解析」である。係り受け解析は、文中の語句がどの語句を修飾しているか、主語と述語がどう結び付くかといった文の構造を解析する処理である。「画像セグメンテーション」は画像を意味のある領域に分割する画像認識分野の処理であり、対象が文章ではなく画像である。「サンプリングレート変換」は音声データのサンプリングレートを変更する音声処理であり、対象が文章ではなく音声データである。「正規化」はデータの形式や尺度をそろえる処理を指す語であり、文中の主語・述語の関係という構文構造そのものを解析する処理ではない。いずれも対象とするデータの種類か、扱う処理の内容が設問の条件と異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
モデルに入力する数値特徴量のスケールをそろえる前処理として最も適切なものはどれか。
答えと解説を見る
正解は「標準化」である。標準化は、数値特徴量の平均やばらつきをそろえ、スケールの違いがモデル学習に与える影響を抑える前処理である。帰無仮説は検定、公開鍵暗号化方式はセキュリティ、データポータビリティは個人情報に関する制度論点であり、特徴量のスケール調整ではない。設問では「モデルに入力する数値特徴量」と「スケールをそろえる前処理」を結び付ける。検定、暗号化、制度の用語を除外し、データ準備の標準化を選ぶ。処理の対象と目的を分けて読むことが重要である。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
分類モデルで、陰性を正しく陰性と判定できた割合を表す指標として正しいものはどれか。
答えと解説を見る
正解は「特異度」である。特異度は、実際には陰性であるデータのうち、モデルが正しく陰性と判定できた割合を表す分類評価指標である。RMSE、MAPE、決定係数は主に回帰モデルの予測誤差や当てはまりを評価する指標であり、陰性判定の正しさを直接表すものではない。設問では、評価対象が分類モデルであり、分母が実際の陰性、数える結果が正しく陰性とした件数だと読む。回帰評価指標を除外して特異度を選ぶ。分類か回帰かを最初に明確に分けると候補を絞りやすい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
無作為抽出による偶然のずれと、抽出方法による系統的な偏りを区別した説明として最も適切なものはどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「標本誤差は偶然生じるばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差」に絞れる。正解は「標本誤差は偶然生じるばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差」である。標本誤差は標本を取る以上避けにくい偶然のずれだが、サンプリングバイアスは集め方が偏っていることで生じる。標本サイズを増やしても、抽出方法が偏ったままだとバイアスは残る。設問では二つの用語を、偶然のばらつきか抽出方法の偏りかで対応付ける。定義を逆にした選択肢、同じ意味とする選択肢、標本サイズだけで必ず解消するとする選択肢を明確に除外する。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
学習データでは高精度だが、新しいデータでは精度が大きく低下した。この現象はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「過学習」に絞れる。正解は「過学習」である。過学習は、訓練データの細かな癖やノイズまで覚えてしまい、未知データに対する汎化性能が下がる現象を指す。「標準化」は変数ごとに異なる数値のスケールをそろえる前処理であり、現象の名称ではない。「交差検証」はデータを複数に分割してモデルの性能を評価する方法であり、過学習が起きていないかを確認する手段ではあっても、現象そのものの名称ではない。「次元の呪い」は特徴量の次元数が増えることでデータが疎になり学習や距離の計算が難しくなる別の問題であり、訓練データへの過剰な適合を原因とする過学習とは発生要因が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
疾病スクリーニングで、実際の患者を見逃さず陽性と判定できた割合を確認したい。使う指標はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「Recall(再現率)」に絞れる。正解は「Recall(再現率)」である。Recallは、実際に陽性であるデータのうち、モデルが正しく陽性と判定できた割合を表す。病気の見逃しを減らしたい場面では、陽性者をどれだけ拾えたかが重要になる。これに対して「Precision(適合率)」は、モデルが陽性と判定した中で実際に陽性だった割合を表し、割合の分母が「実際の陽性者数」か「陽性と判定した数」かでRecallとは異なる。「RMSE」と「決定係数」はいずれも回帰モデルの評価指標であり、予測値と実測値のずれの大きさや目的変数のばらつきの説明度を表すもので、陽性・陰性の分類結果の割合を表す指標ではない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
正解ラベル付き購買データで予測する方法と、ラベルなしデータから構造を探す方法の区別として正しいものはどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「教師あり学習は正解データ(ラベル)を用い、教師なし学習は用いない」に絞れる。正解は「教師あり学習は正解データ(ラベル)を用い、教師なし学習は用いない」である。教師あり学習は入力と正解ラベルの対応関係から学習し、単回帰分析や重回帰分析のような回帰、ロジスティック回帰分析のような分類のいずれも扱う。教師なし学習はラベルを用いず、クラスター分析のようにデータの構造やまとまりを見つける。「教師あり学習は必ず回帰、教師なし学習は必ず分類を行う」は、教師あり学習にロジスティック回帰分析のような分類も含まれる点を無視している。「教師あり学習と教師なし学習に違いはない」は、正解ラベルを使うかどうかという最も基本的な違いを否定してしまっている。「教師なし学習の方が必ず精度が高い」は、正解ラベルなしで学習する教師なし学習と、ラベルを使って学習する教師あり学習の精度を単純に比較できるという前提が誤りである。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
複数の決定木を組み合わせる方法ではないものが候補に混ざっている。それはどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「ホールドアウト法」に絞れる。正解は「ホールドアウト法」である。Random Forestは複数の決定木の多数決・平均を取る手法、XGBoostとLightGBMは決定木を順に追加していく勾配ブースティング(GBDT)の実装であり、いずれも決定木を組み合わせて予測精度を高めるアンサンブル学習の手法である。ホールドアウト法はデータを学習用と評価用に分割してモデルの性能を検証する手法であり、決定木を組み合わせて予測するアンサンブル学習の手法ではない。3つが「複数の決定木をどう組み合わせて予測するか」という同じ問いに答える手法である一方、ホールドアウト法は「学習したモデルをどう評価するか」という別の問いに答える手法であり、単独で異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
『顧客が商品を購入した』という文から、誰が何をしたかという関係を取り出したい。該当する処理はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「係り受け解析」に絞れる。正解は「係り受け解析」である。係り受け解析は、文中の語句がどの語句を修飾しているか、主語と述語がどう結び付くかといった文の構造を解析する処理である。「画像セグメンテーション」は画像を意味のある領域に分割する画像認識分野の処理であり、対象が文章ではなく画像である。「サンプリングレート変換」は音声データのサンプリングレートを変更する音声処理であり、対象が文章ではなく音声データである。「正規化」はデータの形式や尺度をそろえる処理を指す語であり、文中の主語・述語の関係という構文構造そのものを解析する処理ではない。いずれも対象とするデータの種類か、扱う処理の内容が設問の条件と異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
平均やばらつきが異なる複数の数値特徴量を、学習前に比較可能な尺度へそろえたい。使う前処理はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「標準化」に絞れる。正解は「標準化」である。標準化は、数値特徴量の平均やばらつきをそろえ、スケールの違いがモデル学習に与える影響を抑える前処理である。帰無仮説は検定、公開鍵暗号化方式はセキュリティ、データポータビリティは個人情報に関する制度論点であり、特徴量のスケール調整ではない。設問では「モデルに入力する数値特徴量」と「スケールをそろえる前処理」を結び付ける。検定、暗号化、制度の用語を除外し、データ準備の標準化を選ぶ。処理の対象と目的を分けて読むことが重要である。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
実際に陰性の人を、正しく陰性と判定できた割合を評価したい。使う指標はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「特異度」に絞れる。正解は「特異度」である。特異度は、実際には陰性であるデータのうち、モデルが正しく陰性と判定できた割合を表す分類評価指標である。RMSE、MAPE、決定係数は主に回帰モデルの予測誤差や当てはまりを評価する指標であり、陰性判定の正しさを直接表すものではない。設問では、評価対象が分類モデルであり、分母が実際の陰性、数える結果が正しく陰性とした件数だと読む。回帰評価指標を除外して特異度を選ぶ。分類か回帰かを最初に明確に分けると候補を絞りやすい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。無作為抽出による偶然のずれと、抽出方法による系統的な偏りを区別した説明として最も適切なものはどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「標本誤差は偶然生じるばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差」を採用できる。正解は「標本誤差は偶然生じるばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差」である。標本誤差は標本を取る以上避けにくい偶然のずれだが、サンプリングバイアスは集め方が偏っていることで生じる。標本サイズを増やしても、抽出方法が偏ったままだとバイアスは残る。設問では二つの用語を、偶然のばらつきか抽出方法の偏りかで対応付ける。定義を逆にした選択肢、同じ意味とする選択肢、標本サイズだけで必ず解消するとする選択肢を明確に除外する。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。学習データでは高精度だが、新しいデータでは精度が大きく低下した。この現象はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「過学習」を採用できる。正解は「過学習」である。過学習は、訓練データの細かな癖やノイズまで覚えてしまい、未知データに対する汎化性能が下がる現象を指す。「標準化」は変数ごとに異なる数値のスケールをそろえる前処理であり、現象の名称ではない。「交差検証」はデータを複数に分割してモデルの性能を評価する方法であり、過学習が起きていないかを確認する手段ではあっても、現象そのものの名称ではない。「次元の呪い」は特徴量の次元数が増えることでデータが疎になり学習や距離の計算が難しくなる別の問題であり、訓練データへの過剰な適合を原因とする過学習とは発生要因が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。疾病スクリーニングで、実際の患者を見逃さず陽性と判定できた割合を確認したい。使う指標はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「Recall(再現率)」を採用できる。正解は「Recall(再現率)」である。Recallは、実際に陽性であるデータのうち、モデルが正しく陽性と判定できた割合を表す。病気の見逃しを減らしたい場面では、陽性者をどれだけ拾えたかが重要になる。これに対して「Precision(適合率)」は、モデルが陽性と判定した中で実際に陽性だった割合を表し、割合の分母が「実際の陽性者数」か「陽性と判定した数」かでRecallとは異なる。「RMSE」と「決定係数」はいずれも回帰モデルの評価指標であり、予測値と実測値のずれの大きさや目的変数のばらつきの説明度を表すもので、陽性・陰性の分類結果の割合を表す指標ではない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。正解ラベル付き購買データで予測する方法と、ラベルなしデータから構造を探す方法の区別として正しいものはどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「教師あり学習は正解データ(ラベル)を用い、教師なし学習は用いない」を採用できる。正解は「教師あり学習は正解データ(ラベル)を用い、教師なし学習は用いない」である。教師あり学習は入力と正解ラベルの対応関係から学習し、単回帰分析や重回帰分析のような回帰、ロジスティック回帰分析のような分類のいずれも扱う。教師なし学習はラベルを用いず、クラスター分析のようにデータの構造やまとまりを見つける。「教師あり学習は必ず回帰、教師なし学習は必ず分類を行う」は、教師あり学習にロジスティック回帰分析のような分類も含まれる点を無視している。「教師あり学習と教師なし学習に違いはない」は、正解ラベルを使うかどうかという最も基本的な違いを否定してしまっている。「教師なし学習の方が必ず精度が高い」は、正解ラベルなしで学習する教師なし学習と、ラベルを使って学習する教師あり学習の精度を単純に比較できるという前提が誤りである。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。複数の決定木を組み合わせる方法ではないものが候補に混ざっている。それはどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「ホールドアウト法」を採用できる。正解は「ホールドアウト法」である。Random Forestは複数の決定木の多数決・平均を取る手法、XGBoostとLightGBMは決定木を順に追加していく勾配ブースティング(GBDT)の実装であり、いずれも決定木を組み合わせて予測精度を高めるアンサンブル学習の手法である。ホールドアウト法はデータを学習用と評価用に分割してモデルの性能を検証する手法であり、決定木を組み合わせて予測するアンサンブル学習の手法ではない。3つが「複数の決定木をどう組み合わせて予測するか」という同じ問いに答える手法である一方、ホールドアウト法は「学習したモデルをどう評価するか」という別の問いに答える手法であり、単独で異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。『顧客が商品を購入した』という文から、誰が何をしたかという関係を取り出したい。該当する処理はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「係り受け解析」を採用できる。正解は「係り受け解析」である。係り受け解析は、文中の語句がどの語句を修飾しているか、主語と述語がどう結び付くかといった文の構造を解析する処理である。「画像セグメンテーション」は画像を意味のある領域に分割する画像認識分野の処理であり、対象が文章ではなく画像である。「サンプリングレート変換」は音声データのサンプリングレートを変更する音声処理であり、対象が文章ではなく音声データである。「正規化」はデータの形式や尺度をそろえる処理を指す語であり、文中の主語・述語の関係という構文構造そのものを解析する処理ではない。いずれも対象とするデータの種類か、扱う処理の内容が設問の条件と異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。平均やばらつきが異なる複数の数値特徴量を、学習前に比較可能な尺度へそろえたい。使う前処理はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「標準化」を採用できる。正解は「標準化」である。標準化は、数値特徴量の平均やばらつきをそろえ、スケールの違いがモデル学習に与える影響を抑える前処理である。帰無仮説は検定、公開鍵暗号化方式はセキュリティ、データポータビリティは個人情報に関する制度論点であり、特徴量のスケール調整ではない。設問では「モデルに入力する数値特徴量」と「スケールをそろえる前処理」を結び付ける。検定、暗号化、制度の用語を除外し、データ準備の標準化を選ぶ。処理の対象と目的を分けて読むことが重要である。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。実際に陰性の人を、正しく陰性と判定できた割合を評価したい。使う指標はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「特異度」を採用できる。正解は「特異度」である。特異度は、実際には陰性であるデータのうち、モデルが正しく陰性と判定できた割合を表す分類評価指標である。RMSE、MAPE、決定係数は主に回帰モデルの予測誤差や当てはまりを評価する指標であり、陰性判定の正しさを直接表すものではない。設問では、評価対象が分類モデルであり、分母が実際の陰性、数える結果が正しく陰性とした件数だと読む。回帰評価指標を除外して特異度を選ぶ。分類か回帰かを最初に明確に分けると候補を絞りやすい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。無作為抽出による偶然のずれと、抽出方法による系統的な偏りを区別した説明として最も適切なものはどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「標本誤差は偶然生じるばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差」だけが条件を満たす。正解は「標本誤差は偶然生じるばらつき、サンプリングバイアスは抽出方法の偏りによる系統的な誤差」である。標本誤差は標本を取る以上避けにくい偶然のずれだが、サンプリングバイアスは集め方が偏っていることで生じる。標本サイズを増やしても、抽出方法が偏ったままだとバイアスは残る。設問では二つの用語を、偶然のばらつきか抽出方法の偏りかで対応付ける。定義を逆にした選択肢、同じ意味とする選択肢、標本サイズだけで必ず解消するとする選択肢を明確に除外する。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。学習データでは高精度だが、新しいデータでは精度が大きく低下した。この現象はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「過学習」だけが条件を満たす。正解は「過学習」である。過学習は、訓練データの細かな癖やノイズまで覚えてしまい、未知データに対する汎化性能が下がる現象を指す。「標準化」は変数ごとに異なる数値のスケールをそろえる前処理であり、現象の名称ではない。「交差検証」はデータを複数に分割してモデルの性能を評価する方法であり、過学習が起きていないかを確認する手段ではあっても、現象そのものの名称ではない。「次元の呪い」は特徴量の次元数が増えることでデータが疎になり学習や距離の計算が難しくなる別の問題であり、訓練データへの過剰な適合を原因とする過学習とは発生要因が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。疾病スクリーニングで、実際の患者を見逃さず陽性と判定できた割合を確認したい。使う指標はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「Recall(再現率)」だけが条件を満たす。正解は「Recall(再現率)」である。Recallは、実際に陽性であるデータのうち、モデルが正しく陽性と判定できた割合を表す。病気の見逃しを減らしたい場面では、陽性者をどれだけ拾えたかが重要になる。これに対して「Precision(適合率)」は、モデルが陽性と判定した中で実際に陽性だった割合を表し、割合の分母が「実際の陽性者数」か「陽性と判定した数」かでRecallとは異なる。「RMSE」と「決定係数」はいずれも回帰モデルの評価指標であり、予測値と実測値のずれの大きさや目的変数のばらつきの説明度を表すもので、陽性・陰性の分類結果の割合を表す指標ではない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。正解ラベル付き購買データで予測する方法と、ラベルなしデータから構造を探す方法の区別として正しいものはどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「教師あり学習は正解データ(ラベル)を用い、教師なし学習は用いない」だけが条件を満たす。正解は「教師あり学習は正解データ(ラベル)を用い、教師なし学習は用いない」である。教師あり学習は入力と正解ラベルの対応関係から学習し、単回帰分析や重回帰分析のような回帰、ロジスティック回帰分析のような分類のいずれも扱う。教師なし学習はラベルを用いず、クラスター分析のようにデータの構造やまとまりを見つける。「教師あり学習は必ず回帰、教師なし学習は必ず分類を行う」は、教師あり学習にロジスティック回帰分析のような分類も含まれる点を無視している。「教師あり学習と教師なし学習に違いはない」は、正解ラベルを使うかどうかという最も基本的な違いを否定してしまっている。「教師なし学習の方が必ず精度が高い」は、正解ラベルなしで学習する教師なし学習と、ラベルを使って学習する教師あり学習の精度を単純に比較できるという前提が誤りである。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。複数の決定木を組み合わせる方法ではないものが候補に混ざっている。それはどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「ホールドアウト法」だけが条件を満たす。正解は「ホールドアウト法」である。Random Forestは複数の決定木の多数決・平均を取る手法、XGBoostとLightGBMは決定木を順に追加していく勾配ブースティング(GBDT)の実装であり、いずれも決定木を組み合わせて予測精度を高めるアンサンブル学習の手法である。ホールドアウト法はデータを学習用と評価用に分割してモデルの性能を検証する手法であり、決定木を組み合わせて予測するアンサンブル学習の手法ではない。3つが「複数の決定木をどう組み合わせて予測するか」という同じ問いに答える手法である一方、ホールドアウト法は「学習したモデルをどう評価するか」という別の問いに答える手法であり、単独で異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。『顧客が商品を購入した』という文から、誰が何をしたかという関係を取り出したい。該当する処理はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「係り受け解析」だけが条件を満たす。正解は「係り受け解析」である。係り受け解析は、文中の語句がどの語句を修飾しているか、主語と述語がどう結び付くかといった文の構造を解析する処理である。「画像セグメンテーション」は画像を意味のある領域に分割する画像認識分野の処理であり、対象が文章ではなく画像である。「サンプリングレート変換」は音声データのサンプリングレートを変更する音声処理であり、対象が文章ではなく音声データである。「正規化」はデータの形式や尺度をそろえる処理を指す語であり、文中の主語・述語の関係という構文構造そのものを解析する処理ではない。いずれも対象とするデータの種類か、扱う処理の内容が設問の条件と異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。平均やばらつきが異なる複数の数値特徴量を、学習前に比較可能な尺度へそろえたい。使う前処理はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「標準化」だけが条件を満たす。正解は「標準化」である。標準化は、数値特徴量の平均やばらつきをそろえ、スケールの違いがモデル学習に与える影響を抑える前処理である。帰無仮説は検定、公開鍵暗号化方式はセキュリティ、データポータビリティは個人情報に関する制度論点であり、特徴量のスケール調整ではない。設問では「モデルに入力する数値特徴量」と「スケールをそろえる前処理」を結び付ける。検定、暗号化、制度の用語を除外し、データ準備の標準化を選ぶ。処理の対象と目的を分けて読むことが重要である。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。実際に陰性の人を、正しく陰性と判定できた割合を評価したい。使う指標はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「特異度」だけが条件を満たす。正解は「特異度」である。特異度は、実際には陰性であるデータのうち、モデルが正しく陰性と判定できた割合を表す分類評価指標である。RMSE、MAPE、決定係数は主に回帰モデルの予測誤差や当てはまりを評価する指標であり、陰性判定の正しさを直接表すものではない。設問では、評価対象が分類モデルであり、分母が実際の陰性、数える結果が正しく陰性とした件数だと読む。回帰評価指標を除外して特異度を選ぶ。分類か回帰かを最初に明確に分けると候補を絞りやすい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
自然言語処理において、文章中から人名・地名・組織名などの固有の名称を抽出する技術を何と呼ぶか。
答えと解説を見る
正解は「固有表現抽出」である。固有表現抽出は、文章の中から人名・地名・組織名といった固有の名称(固有表現)を検出し分類する技術である。「形態素解析」は文章を単語などの最小単位に分割し品詞を判定する処理であり、固有名詞の抽出そのものを目的とする技術ではない。「係り受け解析」は文中の単語同士の修飾・被修飾の関係を解析する技術であり、固有名詞の抽出とは目的が異なる。「機械翻訳」はある言語の文章を別の言語に変換する技術であり、固有の名称を抽出する処理ではない。したがって、人名・地名・組織名などを文章中から抽出する技術は「固有表現抽出」である。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
文章を単語などの最小単位へ分割し、それぞれの品詞を判定する処理として最も適切なものはどれか。
答えと解説を見る
正解は「形態素解析」である。形態素解析は文章を単語などの最小単位に分割し、各単位の品詞を判定する処理である。固有表現抽出は人名・地名・組織名など特定の名称を取り出すこと、係り受け解析は単語どうしの修飾・被修飾の関係を調べることを目的とする。機械翻訳は文章を別の言語へ変換する処理であり、単語分割と品詞判定を目的としない。まず文章をどの単位に扱うか、次に名称・関係・翻訳のどれを求めるかを分けて考える。設問は文章をどの単位に分け、何を判定するかを示しているため、形態素解析を選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
音声データを扱う際に、音を一定の時間間隔で数値として取得する回数に関わる用語はどれか。
答えと解説を見る
正解は「サンプリングレート」である。サンプリングレートは音声を一定の時間間隔で標本化して数値として扱う回数に関わる用語であり、音声データの基本的な扱いを理解する際の観点になる。音声フォーマットはwavやmp3など、音声を保存・扱う形式に関する語である。セグメンテーションは画像などで領域を分けるタスク、姿勢推定は画像から人などの姿勢を推定するタスクであり、音声を時間ごとに取得する回数とは異なる。設問の対象が音声の記録形式か、画像のタスクか、時間方向の取得回数かを区別する。したがってサンプリングレートを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
連続した数値データを、一定の区間ごとのカテゴリとして扱えるように変換する特徴量化はどれか。
答えと解説を見る
正解は「離散化」である。離散化は連続した数値データをいくつかの区間に分け、カテゴリのように扱える形へ変換する特徴量化である。標準化は数値の尺度をそろえるための変換、対数変換は数値に対数を用いる変換であり、いずれも値を区間ごとのカテゴリに分ける操作ではない。ダミー変数はカテゴリを数値として表すための変数であり、連続値を最初に区間へ分ける処理とは役割が異なる。設問では数値の大きさを調整するのか、区間に分けるのか、カテゴリを表す変数を作るのかを区別する。したがって離散化を選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
回帰モデルの予測値と実際の値の差を絶対値で捉え、その平均で誤差を評価する指標はどれか。
答えと解説を見る
正解は「MAE」である。MAEは回帰モデルの予測値と実際の値の差を絶対値で捉え、その平均によって誤差を評価する指標である。Accuracy、Precision、Recallはいずれも分類の結果を評価する際に用いる指標であり、連続した値の予測と実測の差を平均する設問の条件には合わない。まず、設問が正解・不正解の分類を扱うのか、予測した数値と実際の数値の差を扱うのかを区別する。さらに差を二乗する指標ではなく絶対値を平均する点まで読めば、MAEに絞り込める。したがってMAEを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
分類モデルが「正である」と判定した対象のうち、実際にも正であった対象の割合を表す指標はどれか。
答えと解説を見る
正解は「Precision」である。Precisionは分類モデルが正と判定した対象のうち、実際にも正であった対象の割合を表す指標である。Recallは実際に正である対象をどれだけ正と判定できたかを表すため、分母となる対象が異なる。Accuracyは分類全体で正しく判定できた割合を表し、正と判定した対象だけに注目しない。MAEは回帰モデルの予測値と実際の値の差を絶対値で評価する指標であり、分類の正・負を扱うものではない。設問では「正と判定した対象のうち」という分母に着目する。したがってPrecisionを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
実際には正である対象のうち、分類モデルが正であると判定できた対象の割合を表す指標はどれか。
答えと解説を見る
正解は「Recall」である。Recallは実際に正である対象のうち、分類モデルが正であると判定できた対象の割合を表す指標である。Precisionはモデルが正と判定した対象のうち実際に正であった対象の割合であり、注目する分母が異なる。Accuracyは全ての対象のうち正しく判定できた割合を表すため、実際に正である対象だけに焦点を当てない。MAEは回帰の予測値と実測値の差を絶対値で評価する指標である。見逃しをどれだけ抑えられたかを考えるときは、実際に正である対象を分母にするRecallを確認する。したがってRecallを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
元のデータからモデルの予測に役立つ新たな変数や表現を作る取り組みとして最も適切なものはどれか。
答えと解説を見る
正解は「特徴量エンジニアリング」である。特徴量エンジニアリングは元のデータから、モデルの予測に役立つ新たな変数や表現を作る取り組みを指す。標準化やスケーリングは数値の尺度を整える変換であり、必ずしも新しい情報を持つ変数を作ることを意味しない。外れ値は統計的に極端な値を指す語であり、データから変数を設計する作業の名称ではない。設問では値の大きさを調整する処理か、極端な値を見つけることか、予測の材料となる表現を設計することかを区別する。したがって特徴量エンジニアリングを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
回帰モデルの予測値と実際の値の差を二乗して平均し、その平方根を取って誤差を評価する指標はどれか。
答えと解説を見る
正解は「RMSE」である。RMSEは回帰モデルの予測値と実際の値の差を二乗して平均し、その平方根を取って誤差を評価する指標である。MAEは誤差の絶対値を平均するため、二乗と平方根を用いる設問の条件とは異なる。MAPEは誤差を割合として扱う指標であり、予測値と実測値の差を二乗して扱うものではない。Accuracyは分類で正しく判定できた割合を表す指標であり、回帰の数値誤差を評価しない。誤差を絶対値、割合、二乗のどれで扱うかを確認する。したがってRMSEを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
時間の経過に沿って観測された値を扱う際に、平均や分散などの性質が時間によって大きく変わらない状態を表す語はどれか。
答えと解説を見る
正解は「定常性」である。定常性は時系列データを扱う際に、平均や分散などの性質が時間によって大きく変わらない状態を表す。時系列データは時間の経過に沿って観測されたデータそのものを指し、その性質が一定かどうかを表す語ではない。交差検証とホールドアウト法はモデルの評価に関する方法であり、時間方向のデータの性質を表す概念ではない。時系列を用いて将来を扱う際には、時間が進んでも性質が同じとみなせるかを確認する必要がある。設問ではデータの並び方、評価手法、時間に対して変化しない性質を区別する。したがって定常性を選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)