DS検定 第6章 データエンジニアリング基礎 予想問題と解説
DS検定「第6章 データエンジニアリング基礎」の予想問題を38問収録しています。各問を解説つきで掲載し、全問は演習画面で解けます。公式シラバスの範囲で作成しています。
この章の要点
データ構造・蓄積・環境構築・データ収集・データ加工・共有などを扱う分野です。全38問(基礎2問・標準15問・応用21問)を収録しています。
- データ構造・蓄積
- 環境構築・データ収集
- データ加工・共有
情報源と編集区分
公式範囲を確認し、問題数・難易度・確認点は当サイトが集計・編集。 一次情報確認日: 2026-07-12。
試験概要(公式)確認しておきたいポイント
当サイトの作問時に観察した、取り違えやすい論点です(公式の統計ではありません)。
- 構造化データと非構造化データの判断基準を誤る。テキスト・音声・画像・動画のような雑多な形式か、テーブル形式で管理できるかで区別する。
- 第一正規化から第三正規化までの段階を混同する。各段階でどの種類の重複・従属関係を解消するのかが異なる。
- 内部結合・外部結合・自己結合の使い分けを誤る。条件に一致しない行を残すかどうかで結合方式が変わる。
この章の関連用語
この分野の問題で扱う用語です。意味があいまいなものは、用語集で定義を確認できます。
よくある質問
Q第6章 データエンジニアリング基礎は何問収録されていますか?
現在38問を収録しています。内訳は基礎2問・標準15問・応用21問です。
Q第6章 データエンジニアリング基礎の頻出論点は何ですか?
データ構造・蓄積・環境構築・データ収集・データ加工・共有などが出題対象です(当サイト収録問題に基づく編集部集計)。
Q間違えた問題はどう復習すればいいですか?
誤答した選択肢のどこがずれていたかを解説で確認し、関連用語がある場合は用語集で定義に戻ってから再演習することをおすすめします。
顧客データや在庫データのようにテーブル形式で管理できるデータの分類として正しいものはどれか。
答えと解説を見る
正解は「構造化データ」である。顧客データや在庫データのように、行と列を持つテーブル形式で管理しやすいデータは構造化データに分類される。「非構造化データ」はテキスト、音声、画像、動画のようにテーブル形式で管理しにくいデータの分類であり、設問が問う条件とは逆の性質を持つ。「DWH」はデータを蓄積・統合するための基盤を指す語であり、「NoSQL」はテーブル形式にとらわれないデータベースの種類を指す語であって、いずれもデータそのものの分類名ではない。設問はデータの性質による分類を問うており、蓄積基盤やデータベースの種類を答える選択肢とは問われている対象が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
テーブル内の非キー属性間の従属関係(推移的関数従属)を解消し、テーブルを分割する正規化の段階として正しいものはどれか。
答えと解説を見る
正解は「第三正規化」である。第一正規化は繰り返し項目をなくし、ひとつのセルにひとつの値だけを入れる段階であり、第二正規化は主キーの一部だけに依存する属性を分離する段階である。第三正規化では、これらとは異なり、非キー属性同士の推移的関数従属を解消し、更新時の不整合を起こしにくいテーブル構造にする。「ER図作成」はテーブル同士の関係を図として表す作業であり、テーブル内の属性間の従属関係を解消して分割するという正規化の段階そのものではない。設問は非キー属性間の従属関係を対象とする段階を問うており、主キーへの依存や繰り返し項目を対象とする他の段階とは解消する従属関係の種類が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
既存のDockerイメージを活用して分析環境を効率的に構築する際に理解しておくべき技術として正しいものはどれか。
答えと解説を見る
正解は「コンテナ技術」である。Dockerイメージを使うと、ライブラリや実行環境をまとめたコンテナを再現でき、分析環境を効率よく構築しやすい。「分散技術」は複数のサーバーにデータや処理を分けて扱う技術であり、単一のDockerイメージで実行環境を再現する話とは対象とする技術領域が異なる。「正規表現」は文字列のパターンを表現し検索・置換に使う技術であり、「暗号化技術」は情報を第三者に読めない形に変換する技術であって、いずれもDockerイメージを使った分析環境の構築という設問の目的とは異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
表計算ソフトのデータファイルに対して、単一条件で2つの表を結合し、一致しない行も残す結合方式として最も適切なものはどれか。
答えと解説を見る
正解は「外部結合」である。内部結合は結合条件に一致する行だけを残すが、外部結合は一致しない行も含めて結果に残せる。「自己結合」は同じ表同士の結合を指す語であり、一致する行を残すか一致しない行も残すかという結合結果の性質を表す語ではない。「UNION処理」は複数の表の行を縦方向に結合する操作であり、単一条件で2つの表を横方向に結び付ける結合方式とは処理の向きが異なる。設問は「一致しない行も残す」という結合結果の性質を問うており、結合対象や結合の向きを表す他の選択肢とは問われている軸が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
HadoopやSparkに代表される、大量データを複数のサーバーで分散して処理する技術の基本的な仕組みを理解する分野として最も適切なものはどれか。
答えと解説を見る
正解は「分散技術」である。HadoopやSparkは、大量データを複数のサーバーに分けて処理し、単一マシンでは扱いにくい規模の処理を実現する技術として理解する。暗号化技術はセキュリティ、特徴量エンジニアリングはモデル入力の加工、実験計画法はデータ取得や比較設計の考え方である。設問では製品名だけでなく、「大量データ」「複数のサーバー」「分けて処理」という仕組みを結び付ける。この三つの条件が示す処理方式として分散技術を選ぶ。処理対象と実行方式を一組で確認すると迷いにくい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
外部サービスの機能やデータをプログラムから利用するための窓口として最も適切なものはどれか。
答えと解説を見る
正解は「API」である。APIは外部サービスの機能やデータをプログラムから利用するための窓口であり、データ収集やシステム連携で使われる。ベン図や対称差集合は集合論、不偏分散は統計の概念であり、外部サービスを呼び出すインターフェースではない。設問では、外部サービスを人が画面から使う方法ではなく、プログラムから機能やデータを利用する窓口を問うている。集合論と統計の用語を除外し、APIを選ぶ。利用主体がプログラムである点を最後まで見落とさない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
軽量なデータ交換形式として広く使われ、REST APIの応答でもよく利用される形式はどれか。
答えと解説を見る
正解は「JSON」である。JSONは軽量なデータ交換形式で、REST APIの応答や設定ファイルなどで広く利用される。ER図はデータ構造の設計図、DWHはデータを蓄積・分析する基盤、AUCは分類モデル評価の指標であり、データ交換形式そのものではない。設問では「軽量」「データ交換形式」「REST APIの応答」の三条件を一組で読む。設計図、蓄積基盤、モデル評価指標を除外し、形式を表すJSONを選ぶ。何を表す用語かを分類すれば、交換形式だけを残せる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
顧客ID、購入日、金額を行と列で管理するデータの分類として最も適切なものはどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「構造化データ」に絞れる。正解は「構造化データ」である。顧客データや在庫データのように、行と列を持つテーブル形式で管理しやすいデータは構造化データに分類される。「非構造化データ」はテキスト、音声、画像、動画のようにテーブル形式で管理しにくいデータの分類であり、設問が問う条件とは逆の性質を持つ。「DWH」はデータを蓄積・統合するための基盤を指す語であり、「NoSQL」はテーブル形式にとらわれないデータベースの種類を指す語であって、いずれもデータそのものの分類名ではない。設問はデータの性質による分類を問うており、蓄積基盤やデータベースの種類を答える選択肢とは問われている対象が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
非キー属性が別の非キー属性に依存するテーブルを分割した。到達する正規形はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「第三正規化」に絞れる。正解は「第三正規化」である。第一正規化は繰り返し項目をなくし、ひとつのセルにひとつの値だけを入れる段階であり、第二正規化は主キーの一部だけに依存する属性を分離する段階である。第三正規化では、これらとは異なり、非キー属性同士の推移的関数従属を解消し、更新時の不整合を起こしにくいテーブル構造にする。「ER図作成」はテーブル同士の関係を図として表す作業であり、テーブル内の属性間の従属関係を解消して分割するという正規化の段階そのものではない。設問は非キー属性間の従属関係を対象とする段階を問うており、主キーへの依存や繰り返し項目を対象とする他の段階とは解消する従属関係の種類が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
同じ分析環境を別の端末でも再現するため、既存イメージから隔離環境を起動した。中心となる技術はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「コンテナ技術」に絞れる。正解は「コンテナ技術」である。Dockerイメージを使うと、ライブラリや実行環境をまとめたコンテナを再現でき、分析環境を効率よく構築しやすい。「分散技術」は複数のサーバーにデータや処理を分けて扱う技術であり、単一のDockerイメージで実行環境を再現する話とは対象とする技術領域が異なる。「正規表現」は文字列のパターンを表現し検索・置換に使う技術であり、「暗号化技術」は情報を第三者に読めない形に変換する技術であって、いずれもDockerイメージを使った分析環境の構築という設問の目的とは異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
店舗マスタと売上表を結合し、片方にしかない行も結果へ残したい。適切な結合方式はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「外部結合」に絞れる。正解は「外部結合」である。内部結合は結合条件に一致する行だけを残すが、外部結合は一致しない行も含めて結果に残せる。「自己結合」は同じ表同士の結合を指す語であり、一致する行を残すか一致しない行も残すかという結合結果の性質を表す語ではない。「UNION処理」は複数の表の行を縦方向に結合する操作であり、単一条件で2つの表を横方向に結び付ける結合方式とは処理の向きが異なる。設問は「一致しない行も残す」という結合結果の性質を問うており、結合対象や結合の向きを表す他の選択肢とは問われている軸が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
単一サーバーでは処理できないログを複数ノードへ分けて計算したい。該当する技術分野はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「分散技術」に絞れる。正解は「分散技術」である。HadoopやSparkは、大量データを複数のサーバーに分けて処理し、単一マシンでは扱いにくい規模の処理を実現する技術として理解する。暗号化技術はセキュリティ、特徴量エンジニアリングはモデル入力の加工、実験計画法はデータ取得や比較設計の考え方である。設問では製品名だけでなく、「大量データ」「複数のサーバー」「分けて処理」という仕組みを結び付ける。この三つの条件が示す処理方式として分散技術を選ぶ。処理対象と実行方式を一組で確認すると迷いにくい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
社外サービスの機能を、自社プログラムから決められた形式で呼び出したい。利用する窓口はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「API」に絞れる。正解は「API」である。APIは外部サービスの機能やデータをプログラムから利用するための窓口であり、データ収集やシステム連携で使われる。ベン図や対称差集合は集合論、不偏分散は統計の概念であり、外部サービスを呼び出すインターフェースではない。設問では、外部サービスを人が画面から使う方法ではなく、プログラムから機能やデータを利用する窓口を問うている。集合論と統計の用語を除外し、APIを選ぶ。利用主体がプログラムである点を最後まで見落とさない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
REST APIから返すデータを、軽量なキーと値の形式で表現したい。適切な形式はどれか。
答えと解説を見る
この事例では、状況を表す条件を定義や役割へ対応させると「JSON」に絞れる。正解は「JSON」である。JSONは軽量なデータ交換形式で、REST APIの応答や設定ファイルなどで広く利用される。ER図はデータ構造の設計図、DWHはデータを蓄積・分析する基盤、AUCは分類モデル評価の指標であり、データ交換形式そのものではない。設問では「軽量」「データ交換形式」「REST APIの応答」の三条件を一組で読む。設計図、蓄積基盤、モデル評価指標を除外し、形式を表すJSONを選ぶ。何を表す用語かを分類すれば、交換形式だけを残せる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。顧客ID、購入日、金額を行と列で管理するデータの分類として最も適切なものはどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「構造化データ」を採用できる。正解は「構造化データ」である。顧客データや在庫データのように、行と列を持つテーブル形式で管理しやすいデータは構造化データに分類される。「非構造化データ」はテキスト、音声、画像、動画のようにテーブル形式で管理しにくいデータの分類であり、設問が問う条件とは逆の性質を持つ。「DWH」はデータを蓄積・統合するための基盤を指す語であり、「NoSQL」はテーブル形式にとらわれないデータベースの種類を指す語であって、いずれもデータそのものの分類名ではない。設問はデータの性質による分類を問うており、蓄積基盤やデータベースの種類を答える選択肢とは問われている対象が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。非キー属性が別の非キー属性に依存するテーブルを分割した。到達する正規形はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「第三正規化」を採用できる。正解は「第三正規化」である。第一正規化は繰り返し項目をなくし、ひとつのセルにひとつの値だけを入れる段階であり、第二正規化は主キーの一部だけに依存する属性を分離する段階である。第三正規化では、これらとは異なり、非キー属性同士の推移的関数従属を解消し、更新時の不整合を起こしにくいテーブル構造にする。「ER図作成」はテーブル同士の関係を図として表す作業であり、テーブル内の属性間の従属関係を解消して分割するという正規化の段階そのものではない。設問は非キー属性間の従属関係を対象とする段階を問うており、主キーへの依存や繰り返し項目を対象とする他の段階とは解消する従属関係の種類が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。同じ分析環境を別の端末でも再現するため、既存イメージから隔離環境を起動した。中心となる技術はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「コンテナ技術」を採用できる。正解は「コンテナ技術」である。Dockerイメージを使うと、ライブラリや実行環境をまとめたコンテナを再現でき、分析環境を効率よく構築しやすい。「分散技術」は複数のサーバーにデータや処理を分けて扱う技術であり、単一のDockerイメージで実行環境を再現する話とは対象とする技術領域が異なる。「正規表現」は文字列のパターンを表現し検索・置換に使う技術であり、「暗号化技術」は情報を第三者に読めない形に変換する技術であって、いずれもDockerイメージを使った分析環境の構築という設問の目的とは異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。店舗マスタと売上表を結合し、片方にしかない行も結果へ残したい。適切な結合方式はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「外部結合」を採用できる。正解は「外部結合」である。内部結合は結合条件に一致する行だけを残すが、外部結合は一致しない行も含めて結果に残せる。「自己結合」は同じ表同士の結合を指す語であり、一致する行を残すか一致しない行も残すかという結合結果の性質を表す語ではない。「UNION処理」は複数の表の行を縦方向に結合する操作であり、単一条件で2つの表を横方向に結び付ける結合方式とは処理の向きが異なる。設問は「一致しない行も残す」という結合結果の性質を問うており、結合対象や結合の向きを表す他の選択肢とは問われている軸が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。単一サーバーでは処理できないログを複数ノードへ分けて計算したい。該当する技術分野はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「分散技術」を採用できる。正解は「分散技術」である。HadoopやSparkは、大量データを複数のサーバーに分けて処理し、単一マシンでは扱いにくい規模の処理を実現する技術として理解する。暗号化技術はセキュリティ、特徴量エンジニアリングはモデル入力の加工、実験計画法はデータ取得や比較設計の考え方である。設問では製品名だけでなく、「大量データ」「複数のサーバー」「分けて処理」という仕組みを結び付ける。この三つの条件が示す処理方式として分散技術を選ぶ。処理対象と実行方式を一組で確認すると迷いにくい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。社外サービスの機能を、自社プログラムから決められた形式で呼び出したい。利用する窓口はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「API」を採用できる。正解は「API」である。APIは外部サービスの機能やデータをプログラムから利用するための窓口であり、データ収集やシステム連携で使われる。ベン図や対称差集合は集合論、不偏分散は統計の概念であり、外部サービスを呼び出すインターフェースではない。設問では、外部サービスを人が画面から使う方法ではなく、プログラムから機能やデータを利用する窓口を問うている。集合論と統計の用語を除外し、APIを選ぶ。利用主体がプログラムである点を最後まで見落とさない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
品質レビューで次の判断を再検証する。REST APIから返すデータを、軽量なキーと値の形式で表現したい。適切な形式はどれか 根拠と用語の対応まで確認して選べ。
答えと解説を見る
レビューでは、設問の対象と役割を分けると「JSON」を採用できる。正解は「JSON」である。JSONは軽量なデータ交換形式で、REST APIの応答や設定ファイルなどで広く利用される。ER図はデータ構造の設計図、DWHはデータを蓄積・分析する基盤、AUCは分類モデル評価の指標であり、データ交換形式そのものではない。設問では「軽量」「データ交換形式」「REST APIの応答」の三条件を一組で読む。設計図、蓄積基盤、モデル評価指標を除外し、形式を表すJSONを選ぶ。何を表す用語かを分類すれば、交換形式だけを残せる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。顧客ID、購入日、金額を行と列で管理するデータの分類として最も適切なものはどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「構造化データ」だけが条件を満たす。正解は「構造化データ」である。顧客データや在庫データのように、行と列を持つテーブル形式で管理しやすいデータは構造化データに分類される。「非構造化データ」はテキスト、音声、画像、動画のようにテーブル形式で管理しにくいデータの分類であり、設問が問う条件とは逆の性質を持つ。「DWH」はデータを蓄積・統合するための基盤を指す語であり、「NoSQL」はテーブル形式にとらわれないデータベースの種類を指す語であって、いずれもデータそのものの分類名ではない。設問はデータの性質による分類を問うており、蓄積基盤やデータベースの種類を答える選択肢とは問われている対象が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。非キー属性が別の非キー属性に依存するテーブルを分割した。到達する正規形はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「第三正規化」だけが条件を満たす。正解は「第三正規化」である。第一正規化は繰り返し項目をなくし、ひとつのセルにひとつの値だけを入れる段階であり、第二正規化は主キーの一部だけに依存する属性を分離する段階である。第三正規化では、これらとは異なり、非キー属性同士の推移的関数従属を解消し、更新時の不整合を起こしにくいテーブル構造にする。「ER図作成」はテーブル同士の関係を図として表す作業であり、テーブル内の属性間の従属関係を解消して分割するという正規化の段階そのものではない。設問は非キー属性間の従属関係を対象とする段階を問うており、主キーへの依存や繰り返し項目を対象とする他の段階とは解消する従属関係の種類が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。同じ分析環境を別の端末でも再現するため、既存イメージから隔離環境を起動した。中心となる技術はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「コンテナ技術」だけが条件を満たす。正解は「コンテナ技術」である。Dockerイメージを使うと、ライブラリや実行環境をまとめたコンテナを再現でき、分析環境を効率よく構築しやすい。「分散技術」は複数のサーバーにデータや処理を分けて扱う技術であり、単一のDockerイメージで実行環境を再現する話とは対象とする技術領域が異なる。「正規表現」は文字列のパターンを表現し検索・置換に使う技術であり、「暗号化技術」は情報を第三者に読めない形に変換する技術であって、いずれもDockerイメージを使った分析環境の構築という設問の目的とは異なる役割を持つ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。店舗マスタと売上表を結合し、片方にしかない行も結果へ残したい。適切な結合方式はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「外部結合」だけが条件を満たす。正解は「外部結合」である。内部結合は結合条件に一致する行だけを残すが、外部結合は一致しない行も含めて結果に残せる。「自己結合」は同じ表同士の結合を指す語であり、一致する行を残すか一致しない行も残すかという結合結果の性質を表す語ではない。「UNION処理」は複数の表の行を縦方向に結合する操作であり、単一条件で2つの表を横方向に結び付ける結合方式とは処理の向きが異なる。設問は「一致しない行も残す」という結合結果の性質を問うており、結合対象や結合の向きを表す他の選択肢とは問われている軸が異なる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。単一サーバーでは処理できないログを複数ノードへ分けて計算したい。該当する技術分野はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「分散技術」だけが条件を満たす。正解は「分散技術」である。HadoopやSparkは、大量データを複数のサーバーに分けて処理し、単一マシンでは扱いにくい規模の処理を実現する技術として理解する。暗号化技術はセキュリティ、特徴量エンジニアリングはモデル入力の加工、実験計画法はデータ取得や比較設計の考え方である。設問では製品名だけでなく、「大量データ」「複数のサーバー」「分けて処理」という仕組みを結び付ける。この三つの条件が示す処理方式として分散技術を選ぶ。処理対象と実行方式を一組で確認すると迷いにくい。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。社外サービスの機能を、自社プログラムから決められた形式で呼び出したい。利用する窓口はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「API」だけが条件を満たす。正解は「API」である。APIは外部サービスの機能やデータをプログラムから利用するための窓口であり、データ収集やシステム連携で使われる。ベン図や対称差集合は集合論、不偏分散は統計の概念であり、外部サービスを呼び出すインターフェースではない。設問では、外部サービスを人が画面から使う方法ではなく、プログラムから機能やデータを利用する窓口を問うている。集合論と統計の用語を除外し、APIを選ぶ。利用主体がプログラムである点を最後まで見落とさない。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
誤答除外の観点から次のケースを検討する。REST APIから返すデータを、軽量なキーと値の形式で表現したい。適切な形式はどれか 他の候補が条件を満たさないことも確認して選べ。
答えと解説を見る
誤答候補を役割ごとに除外すると「JSON」だけが条件を満たす。正解は「JSON」である。JSONは軽量なデータ交換形式で、REST APIの応答や設定ファイルなどで広く利用される。ER図はデータ構造の設計図、DWHはデータを蓄積・分析する基盤、AUCは分類モデル評価の指標であり、データ交換形式そのものではない。設問では「軽量」「データ交換形式」「REST APIの応答」の三条件を一組で読む。設計図、蓄積基盤、モデル評価指標を除外し、形式を表すJSONを選ぶ。何を表す用語かを分類すれば、交換形式だけを残せる。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
テーブル設計で、繰り返し現れる値を一つの欄にまとめず、扱いやすい形へ整理するために第一正規化から第三正規化までの手法を用いる考え方はどれか。
答えと解説を見る
正解は「正規化」である。正規化は、第一正規化から第三正規化などの手法を用いてテーブルを整理する設計の考え方である。ER図はテーブル間のリレーションシップを表して読解するための図であり、テーブルをどのように分けて設計するかという手法そのものではない。NoSQLはデータの蓄積に関する技術の一つ、データマートは特定部門や業務目的に向けたデータ基盤を指す。設問では、データをどこに置くかではなく、テーブルの構造をどの原則で整理するかを問うている。したがって正規化を選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
階層的な項目を持つデータを、キーと値の組み合わせとして表現する形式として最も適切なものはどれか。
答えと解説を見る
正解は「JSON」である。JSONはキーと値の組み合わせを使い、階層的な項目を持つデータを表現できる形式である。CSVは値を区切って表形式のデータを扱う形式であり、階層をキーと値の入れ子として表すことを主な特徴としない。XMLもデータを表現する形式だが、設問のキーと値の組み合わせという表現に対応するのはJSONである。REST APIはシステム間でデータや機能をやり取りするための設計に関わる語であり、データファイルの表現形式ではない。設問がデータの構造を問うのか、通信の方法を問うのかを分ける。したがってJSONを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
ネットワークを通じてファイルを安全に転送し、データ収集先へ格納する際に用いる通信方式として最も適切なものはどれか。
答えと解説を見る
正解は「SFTP」である。SFTPはネットワークを通じてファイルを安全に転送し、データ収集先へ格納する際に用いる通信方式である。HTTPSはWeb上で安全に通信するための方式であり、設問のようにファイルを転送して格納する用途を直接表す語ではない。SDKはプラットフォームが提供する機能を利用するための開発用の仕組み、WebクローラーはWeb上の情報を収集するためのプログラムに関する語である。設問では、Web閲覧の通信、開発用機能、情報を取得するプログラムではなく、ファイルを安全に転送する手段を問うている。したがってSFTPを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
組織全体を横断してデータを蓄積し、複数の部門で利用するための集中型データ基盤として最も適切なものはどれか。
答えと解説を見る
正解は「DWH」である。DWHは組織全体を横断するデータを集中して蓄積し、複数の部門や業務で利用するためのデータ基盤である。データマートはDWHなどのデータから特定の部門や業務目的向けに抽出・加工した小規模な基盤を指す。データメッシュはデータの所有・管理をドメインごとに委ねる分散型の運用思想であり、集中型の基盤の名称ではない。オブジェクトストレージはデータの格納に関する仕組みであり、組織横断の分析用途に向けて統合するDWHと役割が異なる。利用範囲が全社横断か特定用途かを判断軸にする。したがってDWHを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
対象プラットフォームが提供する機能を、特定のプログラミング言語から利用しやすくするための開発用部品群を指す語はどれか。
答えと解説を見る
正解は「SDK」である。SDKは対象プラットフォームが提供する機能を、開発者が特定のプログラミング言語などから利用しやすくするための開発用部品群を指す。APIは外部サービスの機能やデータをプログラムから利用する窓口であり、SDKと密接に関わるが、開発用の部品群そのものを指す語ではない。WebクローラーはWeb上の情報を収集するプログラム、スクレイピングはWebページなどから情報を取得する処理に関する語である。設問ではデータを集める手段ではなく、プラットフォーム機能を利用する開発支援の仕組みを問うている。したがってSDKを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
企業内外に分散したデータを、場所や形式にかかわらず統合・管理・活用できるようにする技術的なアーキテクチャはどれか。
答えと解説を見る
正解は「データファブリック」である。データファブリックは、企業内外に分散しているデータを、保存場所や形式の違いを越えて統合・管理・活用できるようにする技術的なアーキテクチャである。データメッシュは、ドメインごとにデータの所有・管理を委ね、データをプロダクトとして提供する分散型の運用思想であり、技術基盤を整える点を中心とするデータファブリックとは重点が異なる。データマートは特定部門向けの小規模な基盤、DWHは組織横断で集中して蓄積する基盤である。設問が統合のための技術的アーキテクチャを問う点に注目して、データファブリックを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-08-22公式スキルチェックリストver.6照合)
クラウド上で、データをオブジェクトとして格納・管理するための仕組みはどれか。
答えと解説を見る
正解は「オブジェクトストレージ」である。オブジェクトストレージは、クラウド上でデータをオブジェクトとして格納・管理するための仕組みである。DWHは組織横断でデータを集中して蓄積・分析利用する基盤、データマートは特定部門や業務目的向けに抽出・加工した小規模な基盤を指す。データメッシュは、データの所有・管理をドメインごとに委ねる分散型の運用思想である。設問は分析対象のデータをどの形で格納するかを問うており、組織の利用範囲や管理体制を表す用語ではない。格納する仕組みという役割に注目して、オブジェクトストレージを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-08-22公式スキルチェックリストver.6照合)
テキストデータをコンピュータがどの数値の並びとして扱うかを定める仕組みはどれか。
答えと解説を見る
正解は「文字コード」である。文字コードは、文字をコンピュータが扱う数値の並びに対応付ける仕組みである。データを読み書きしたときに想定と異なる文字コードが使われると、文字化けなどが起こり得る。正規表現は文字列のパターンを表して検索や置換に使う表現、JSONはデータを記述する形式、REST APIはシステム間で機能やデータをやり取りする際の考え方に関する用語である。設問は文字列の内容をどのような数値として解釈するかを問うているため、文字コードを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
Web上のシステム間で、決められた方法に従って機能やデータをやり取りするインターフェースの考え方はどれか。
答えと解説を見る
正解は「REST API」である。REST APIは、Web上のシステム間で、決められた方法に従って機能やデータをやり取りするためのインターフェースに関する考え方である。JSONはデータを記述する形式であり、REST APIでデータを受け渡す際に利用されることはあるが、通信のインターフェースそのものを表す名称ではない。正規表現は文字列のパターンを扱う表現、文字コードは文字と数値の対応付けの仕組みである。設問が問うのはデータの表記ではなく、システム同士が機能を呼び出したりデータを受け渡したりする接点である。したがってREST APIを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-07-12公式スキルチェックリストver.6照合)
データの所有・管理をドメインごとに委ね、各ドメインがデータをプロダクトとして提供する分散型の運用思想はどれか。
答えと解説を見る
正解は「データメッシュ」である。データメッシュは、データの所有・管理をドメインごとに委ね、各ドメインが自らのデータをプロダクトとして設計・提供する分散型の運用思想である。データファブリックは企業内外に分散したデータを統合・管理・活用しやすくする技術的アーキテクチャであり、組織の責任分担を中心にするデータメッシュとは重点が異なる。DWHは組織横断のデータを集中して蓄積する基盤、データマートは特定部門や用途向けの小規模な基盤である。設問が問うのは格納先ではなく、ドメインごとの所有と提供という運用体制なので、データメッシュを選ぶ。
https://github.com/The-Japan-DataScientist-Society/skills-checklist (2026-08-22公式スキルチェックリストver.6照合)