AI資格ドリル
資格を選ぶ↓

G検定 用語解説

音声合成とは

文字(テキスト)から人の話し声に近い音声を作り出す技術。WaveNetは自然な音声波形を生成する代表的な音声合成モデルの一つ。

まず押さえる結論

音声合成は、G検定の「大項目6 ディープラーニングの応用例」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-07-03。

試験概要(公式)

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

×物体検出(R-CNN系/YOLO/SSD)とセグメンテーション(セマンティック=画素単位の塗り分け、インスタンス=個体ごとに区別)の混同。

×word2vec・BERT・GPTの違い(BERT=前後両方向、GPT=一方向・自己回帰)。

×強化学習の応用(DQN、AlphaGo)と画像/言語タスクの取り違え。

関連する確認問題

大項目6 ディープラーニングの応用例 / 音声・強化学習

人間の話した音声(話し言葉)を、テキスト(文字列)に変換する技術を何というか。

正解は「音声認識」である。音声認識は、人間の話した音声をテキスト(文字列)に変換する技術である。逆に、テキストから音声を作り出すのは音声合成である。物体検出は画像中の物体の位置とクラスを推定する技術、機械翻訳はある言語の文章を別の言語に変換する技術であり、いずれも音声を文字に変換する技術ではない。 変換の入力と出力を矢印で整理する。音声合成は文字から音声への逆方向、物体検出は画像から物体位置、機械翻訳はある言語の文字列から別言語の文字列へ変換する。音声から文字への変換は音声認識である。

大項目6 ディープラーニングの応用例 / 画像認識・物体検出

画像内の物体の種類だけでなく、位置を囲む枠も推定するタスクとして最も適切なものはどれか。

正解は「物体検出」である。物体検出は、画像内に何があるかだけでなく、その位置をバウンディングボックスなどで推定するタスクである。画像認識は画像全体の分類を指すことが多い。機械翻訳は言語変換、音声合成はテキストなどから音声を作る技術であり、画像内の物体位置を推定するタスクではない。 画像タスクは出力粒度で区別する。画像認識は画像全体のクラスを返す場合が中心で、位置の枠を必須としない。機械翻訳と音声合成は言語・音声の変換である。物体ごとの種類と矩形位置を返すのが物体検出である。

大項目6 ディープラーニングの応用例 / 音声・強化学習

音声波形を直接扱い、高品質な音声生成・音声合成と関連して知られるディープラーニングモデルはどれか。

正解は「WaveNet」である。WaveNetは音声波形を扱うディープラーニングモデルとして知られ、音声生成や音声合成と関連する。YOLOは物体検出、BERTは自然言語処理、U-Netは画像のセグメンテーションでよく使われるモデルである。 候補を媒体とタスクで分ける。YOLOは画像の物体検出、BERTはTransformer系の自然言語モデル、U-Netは画像領域分割である。時間方向の音声波形サンプルを条件付きで順次生成するモデルはWaveNetである。

同じ章で確認したい用語

到達チェック

  • 音声合成を一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、音声合成に関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部運営者情報を見る