Topics: Reinforcement Learning
Suppose Pθ is a parametrized probability distribution over random variable x, for example a stochastic policy, which is a parametrized probability distribution over actions.
Then
x∼PθE[∇θPθ(x)]=0
∫xPθ(x)=1probabilitydistributionsarenormalized∇θ∫xPθ(x)=∇θ1=0gradientbothsides∫x∇θPθ(x)=0∫xPθ(x)⋅∇θlog(P(x))=0log−derivativetrickx∼PθE[∇θlog(P(x))]=0backtoexpectationform
- https://spinningup.openai.com/en/latest/spinningup/rl_intro3.html