AI資格ドリル
資格を選ぶ↓

G検定 用語解説

Actor-Criticとは

方策を表すActorと、行動の価値を推定するCriticを分けて持ち、Criticの評価をもとにActorの方策を更新していく強化学習の枠組み。方策勾配法の一種。

まず押さえる結論

Actor-Criticは、G検定の「大項目3 機械学習の概要」で確認しておきたい用語です。定義だけでなく、どの場面で使う言葉か、何と混同しやすいか、問題文のどの表現で判断するかまで確認します。

情報源と編集区分

公式範囲を確認し、具体例・誤答例・判断手順は当サイトが編集。 一次情報確認日: 2026-07-03。

試験概要(公式)

具体例から判断の境界を固める

Actor-Criticを、役割と隣接概念の境界から捉える

方策を表すActorと、行動の価値を推定するCriticを分けて持ち、Criticの評価をもとにActorの方策を更新していく強化学習の枠組み。方策勾配法の一種。 試験では名称だけでなく、処理の対象、目的、使う段階を別概念と入れ替えた選択肢が出るため、定義の主語と動作を分けて確認します。

問題文で見る箇所
方策を表すActorと、行動の価値を推定するCriticを分けて持ち、Criticの評価をもとにActorの方策を更新しているかを確認します。
隣接概念との境界
Actor-Criticは方策勾配法にCriticによる価値推定を組み合わせた枠組みで、Criticを持たない方策勾配法とは、学習に価値関数の推定を使うかどうかで区別します。

誤答しやすい選択肢

  • 価値関数の推定を使わない素の方策勾配法を、CriticがActorを評価するActor-Criticと同じ枠組みとして扱う。定義の主語と処理対象を確認します。
  • Actor-Criticの目的だけを見て、同じ目的を持つ別手法まで同じ用語とする。具体的な処理を比較します。
  • Actor-Criticを使えば目的が必ず達成されると断定する。適用条件や評価を別に確認します。

4段階の判断手順

  1. 01問題文が状態、手法、評価指標、制度のどれを説明しているか決める。
  2. 02定義の中心となる対象と動作がActor-Criticに一致するか確認する。
  3. 03隣接概念と共通する目的ではなく、処理や条件の違いを見る。
  4. 04必ず・完全に・だけでよいという過度な断定がないか見直す。

到達条件: Actor-Criticを一文で説明し、最も混同しやすい隣接概念との違いを処理または条件から言える。

試験での問われ方

01

定義の言い換え

用語そのものではなく、説明文の一部を言い換えて出されることがあります。

02

似た概念との比較

同じ章の用語と入れ替えた選択肢に注意します。対象、目的、使う場面を分けます。

03

具体例からの判断

問題文の事例が、定義のどの部分に対応しているかを先に確認します。

誤答しやすいポイント

×教師あり・教師なし・強化学習の分類の取り違え(分類/回帰=教師あり、クラスタリング/次元削減=教師なし)。

×L1正則化(ラッソ=係数が0になり変数選択も兼ねる)とL2正則化(リッジ=係数を小さく抑えるが0にはなりにくい)の混同。

×適合率(精度)と再現率の取り違え、および混同行列の読み方。

関連する確認問題

大項目3 機械学習の概要 / 機械学習の種類

強化学習で、方策を表す要素と価値関数を推定する要素を分け、後者の評価を使って前者の方策を更新する枠組みはどれか。

正解は「Actor-Critic」である。強化学習の枠組みは、方策そのもののパラメータを直接更新していく方策ベースの発想と、状態や行動の価値を推定してから行動を選ぶ価値ベースの発想に大きく分けられる。Actor-Criticは、方策を受け持つActorと価値の推定を受け持つCriticを分けて持つことでこの2つの発想を組み合わせた枠組みという位置づけにあり、Criticが下す評価を使ってActorの方策を更新する点が設問の条件と一致する。他の選択肢はいずれも方策ベース・価値ベースの一方に立つか、報酬や方策そのものを扱わない教師なし学習であり、ActorとCriticを分けて評価と更新を連携させる構成を持たない。

同じ章で確認したい用語

到達チェック

  • Actor-Criticを一文で説明できる
  • 同じ章の似た用語と違いを説明できる
  • 問題文の具体例から、Actor-Criticに関係する論点を拾える
  • 関連問題を解き、誤答した選択肢の理由を確認できる

執筆: ミナト編集部運営者情報を見る