Policy Gradient

Concept

A core algorithm for reinforcement learning, particularly useful for robotics and large language models, that directly optimizes the policy.

Mentioned in 1 video