Policy Gradient
Concept
A core algorithm for reinforcement learning, particularly useful for robotics and large language models, that directly optimizes the policy.
Mentioned in 1 video
A core algorithm for reinforcement learning, particularly useful for robotics and large language models, that directly optimizes the policy.