G検定 用語解説
方策勾配法とは
状態から行動を選ぶ方策そのものを、期待報酬が大きくなる方向へ直接最適化していく強化学習の手法。行動の価値を推定してから間接的に方策を導く価値ベースの手法とは、学習の対象が異なる。
この記事の目次
まず押さえる結論
方策勾配法は、G検定の「大項目3 機械学習の概要」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。
情報源と編集区分
公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-10-02。
試験概要(公式)具体例から判断の境界を固める
方策勾配法を、役割と隣接概念の境界から捉える
状態から行動を選ぶ方策そのものを、期待報酬が大きくなる方向へ直接最適化していく強化学習の手法。行動の価値を推定してから間接的に方策を導く価値ベースの手法とは、学習の対象が異なる。 試験では名称だけでなく、処理の対象、目的、使う段階を別概念と入れ替えた選択肢が出るため、定義の主語と動作を分けて確認します。
- 問題文で見る箇所
- 行動の価値を推定してから間接的に方策を導くのではなく、方策そのもののパラメータを期待報酬が大きくなる方向へ直接更新しているかを確認します。
- 隣接概念との境界
- 方策勾配法は方策そのものを直接最適化する手法で、価値ベースの手法は行動ごとの価値を推定してから最も価値の高い行動を選びます。Actor-Criticは方策勾配法に価値関数の推定(Critic)を組み合わせた枠組みです。
誤答しやすい選択肢
- 行動ごとの価値を推定してから行動を選ぶ価値ベースの手法を、方策そのものを直接更新する方策勾配法と同じ手法として扱う。定義の主語と処理対象を確認します。
- 方策勾配法の目的だけを見て、同じ目的を持つ別手法まで同じ用語とする。具体的な処理を比較します。
- 方策勾配法を使えば目的が必ず達成されると断定する。適用条件や評価を別に確認します。
4段階の判断手順
- 01問題文が状態、手法、評価指標、制度のどれを説明しているか決める。
- 02定義の中心となる対象と動作が方策勾配法に一致するか確認する。
- 03隣接概念と共通する目的ではなく、処理や条件の違いを見る。
- 04必ず・完全に・だけでよいという過度な断定がないか見直す。
到達条件: 方策勾配法を一文で説明し、最も混同しやすい隣接概念との違いを処理または条件から言える。
試験での問われ方
定義の言い換え
用語そのものではなく、説明文の一部を言い換えて出されることがあります。
似た概念との比較
同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。
具体例からの判断
問題文の事例が、定義のどの部分に対応しているかを先に確認します。
誤答しやすいポイント
「大項目3 機械学習の概要」の問題で、取り違えやすい組み合わせです。
- 教師あり・教師なし・強化学習の分類の取り違え(分類/回帰=教師あり、クラスタリング/次元削減=教師なし)。
- L1正則化(ラッソ=係数が0になり変数選択も兼ねる)とL2正則化(リッジ=係数を小さく抑えるが0にはなりにくい)の混同。
- 適合率(精度)と再現率の取り違えと、混同行列の読み違い。
関連する確認問題
大項目3 機械学習の概要 / 機械学習の種類
強化学習において、状態から行動を選ぶ方策そのものを、期待報酬が大きくなる方向へ直接最適化していく手法はどれか。
正解は「方策勾配法」である。方策勾配法は、状態から行動を選ぶ方策そのものを期待報酬が大きくなる方向へ直接最適化していく強化学習の手法である。Actor-CriticはActorとCriticを分け、Criticの評価を利用してActorの方策を更新する枠組みであり、設問が問う直接最適化という手法名とは区別する。教師あり学習は正解ラベルを用いる学習の枠組みであり、報酬を最大化する方策を扱わない。k-means法はデータをクラスタに分ける教師なし学習であり、行動を選ぶ方策を最適化する手法ではない。学習の対象が方策そのものかを確認すると、方策勾配法に絞り込める。
同じ章で確認したい用語
到達チェック
- 方策勾配法を一文で説明できる
- 同じ章の似た用語と違いを説明できる
- 問題文の具体例から、方策勾配法に関係する論点を拾える
- 関連問題を解き、誤答した選択肢の理由を確認できる
執筆: ミナト編集部(運営者情報を見る)