DS検定 用語解説
Sparkとは
Hadoopと並ぶ代表的な分散処理エンジン。データをメモリ上で処理することで高速な分散処理を実現する。
この記事の目次
まず押さえる結論
Sparkは、DS検定の「第6章 データエンジニアリング基礎」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。
情報源と編集区分
公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-10-02。
試験概要(公式)試験での問われ方
定義の言い換え
用語そのものではなく、説明文の一部を言い換えて出されることがあります。
似た概念との比較
同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。
具体例からの判断
問題文の事例が、定義のどの部分に対応しているかを先に確認します。
誤答しやすいポイント
「第6章 データエンジニアリング基礎」の問題で、取り違えやすい組み合わせです。
- 構造化データと非構造化データの判断基準を誤る。テキスト・音声・画像・動画のような雑多な形式か、テーブル形式で管理できるかで区別する。
- 第一正規化から第三正規化までの段階を混同する。各段階でどの種類の重複・従属関係を解消するのかが異なる。
- 内部結合・外部結合・自己結合の使い分けを誤る。条件に一致しない行を残すかどうかで結合方式が変わる。
関連する確認問題
第6章 データエンジニアリング基礎 / データ構造・蓄積
大量のデータを複数のサーバーに分けて処理する、分散処理の基盤として知られるものはどれか。
大量のデータを複数のサーバーに分けて処理する基盤を答える問題である。正解は「Hadoop」である。Hadoopは、単一のサーバーでは扱いにくい規模のデータを、複数のサーバーに分けて処理する分散処理の基盤で、Sparkと並んで代表例として挙げられる。「Docker」は実行環境を再現するコンテナ技術、「YAML」は設定を書くための構成ファイルの形式、「SDK」は外部サービスを使うための開発用のキットであり、いずれもデータの処理を複数のサーバーに分ける基盤ではない。したがって、設問の基盤はHadoopである。
第6章 データエンジニアリング基礎 / データ構造・蓄積
分散処理と実行環境についての説明として、誤っているものはどれか。
誤っている説明を選ぶので、分散処理の基本から外れたものを探す。正解は「Hadoopは、1台のサーバーの中だけでデータを処理する技術である」である。Hadoopは、大量のデータを複数のサーバーに分けて処理する分散処理の基盤であり、1台のサーバーだけで処理するものではない。Sparkが同様の分散処理の基盤であること、分散技術が処理を複数のサーバーに分けて扱う技術であること、コンテナ技術が実行環境を再現する技術であることは、正しい説明である。したがって、Hadoopを1台のサーバーだけで処理する技術とする説明が、設問の誤った説明である。
第6章 データエンジニアリング基礎 / データ構造・蓄積
分散処理基盤を選ぶ際、大量データをメモリ上で処理して高速な分散処理を行うエンジンとして最も適切なものはどれか。
正解は「Spark」である。設問は、大量のデータをメモリ上で処理することで高速化する分散処理エンジンを尋ねている。この条件に合うのはSparkで、Hadoopも分散処理基盤だが複数サーバーへ分散して蓄積・処理する点が特徴でありメモリ処理を前面に出す語ではない。Dockerはコンテナ技術、SFTPはファイル転送の方式であり、どちらも分散処理エンジンではない。分散処理という共通点だけで決めず、メモリ上で処理して高速化するという特徴まで一致するかを確認して見分ける。
同じ章で確認したい用語
到達チェック
- Sparkを一文で説明できる
- 同じ章の似た用語と違いを説明できる
- 問題文の具体例から、Sparkに関係する論点を拾える
- 関連問題を解き、誤答した選択肢の理由を確認できる
執筆: ミナト編集部(運営者情報を見る)