AI資格ドリル
資格を選ぶ↓

DS検定 用語解説

Webクローラーとは

Webページを巡回し、情報を収集するプログラム。

まず押さえる結論

Webクローラーは、DS検定の「第6章 データエンジニアリング基礎」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-07-12。

試験概要(公式)

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

×構造化データと非構造化データの判断基準を誤る。テキスト・音声・画像・動画のような雑多な形式か、テーブル形式で管理できるかで区別する。

×第一正規化から第三正規化までの段階を混同する。各段階でどの種類の重複・従属関係を解消するのかが異なる。

×内部結合・外部結合・自己結合の使い分けを誤る。条件に一致しない行を残すかどうかで結合方式が変わる。

関連する確認問題

第6章 データエンジニアリング基礎 / データ構造・蓄積

顧客ID、購入日、金額を行と列で管理するデータの分類として最も適切なものはどれか。

この事例では、状況を表す条件を定義や役割へ対応させると「構造化データ」に絞れる。正解は「構造化データ」である。顧客データや在庫データのように、行と列を持つテーブル形式で管理しやすいデータは構造化データに分類される。「非構造化データ」はテキスト、音声、画像、動画のようにテーブル形式で管理しにくいデータの分類であり、設問が問う条件とは逆の性質を持つ。「DWH」はデータを蓄積・統合するための基盤を指す語であり、「NoSQL」はテーブル形式にとらわれないデータベースの種類を指す語であって、いずれもデータそのものの分類名ではない。設問はデータの性質による分類を問うており、蓄積基盤やデータベースの種類を答える選択肢とは問われている対象が異なる。

第6章 データエンジニアリング基礎 / データ構造・蓄積

非キー属性が別の非キー属性に依存するテーブルを分割した。到達する正規形はどれか。

この事例では、状況を表す条件を定義や役割へ対応させると「第三正規化」に絞れる。正解は「第三正規化」である。第一正規化は繰り返し項目をなくし、ひとつのセルにひとつの値だけを入れる段階であり、第二正規化は主キーの一部だけに依存する属性を分離する段階である。第三正規化では、これらとは異なり、非キー属性同士の推移的関数従属を解消し、更新時の不整合を起こしにくいテーブル構造にする。「ER図作成」はテーブル同士の関係を図として表す作業であり、テーブル内の属性間の従属関係を解消して分割するという正規化の段階そのものではない。設問は非キー属性間の従属関係を対象とする段階を問うており、主キーへの依存や繰り返し項目を対象とする他の段階とは解消する従属関係の種類が異なる。

第6章 データエンジニアリング基礎 / 環境構築・データ収集

同じ分析環境を別の端末でも再現するため、既存イメージから隔離環境を起動した。中心となる技術はどれか。

この事例では、状況を表す条件を定義や役割へ対応させると「コンテナ技術」に絞れる。正解は「コンテナ技術」である。Dockerイメージを使うと、ライブラリや実行環境をまとめたコンテナを再現でき、分析環境を効率よく構築しやすい。「分散技術」は複数のサーバーにデータや処理を分けて扱う技術であり、単一のDockerイメージで実行環境を再現する話とは対象とする技術領域が異なる。「正規表現」は文字列のパターンを表現し検索・置換に使う技術であり、「暗号化技術」は情報を第三者に読めない形に変換する技術であって、いずれもDockerイメージを使った分析環境の構築という設問の目的とは異なる役割を持つ。

同じ章で確認したい用語

到達チェック

  • Webクローラーを一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、Webクローラーに関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部運営者情報を見る