Elio Saade
Note

Expected Gradient Log-Probability Lemma

Topics: Reinforcement Learning

Suppose PθP_\theta is a parametrized probability distribution over random variable xx, for example a stochastic policy, which is a parametrized probability distribution over actions.
Then
Ex∼Pθ[∇θ  Pθ(x)]=0\underset{x \sim P_\theta}{E}[\nabla_\theta \; P_\theta(x)] = 0

Proof
∫xPθ(x)=1probability  distributions  are  normalized∇θ  ∫xPθ(x)=∇θ  1=0gradient  both  sides∫x∇θ  Pθ(x)=0∫xPθ(x)⋅∇θ  log(P(x))=0    log−derivative  trickEx∼Pθ[∇θ  log(P(x))]=0      back  to  expectation  form\begin{align*} & \int_x P_\theta(x) = 1 \quad\quad\quad\quad\quad\quad\quad\quad\quad\quad\quad probability\;distributions\;are\;normalized \\ \\ & \nabla_\theta \; \int_x P_\theta(x) = \nabla_\theta \; 1 = 0 \quad\quad\quad\quad\quad\quad gradient\;both\;sides \\ \\ & \int_x \nabla_\theta \; P_\theta(x) = 0 \\ \\ & \int_x P_\theta(x) \cdot \nabla_\theta \; log(P(x)) = 0 \quad\quad\quad\quad\;\; log-derivative\;trick \\ \\ & \underset{x \sim P_\theta}{E}[\nabla_\theta \; log(P(x))] = 0 \quad\quad\quad\quad\quad\quad\;\;\; back\;to\;expectation\;form \end{align*}

References

  1. https://spinningup.openai.com/en/latest/spinningup/rl_intro3.html

Connections

Direct relationships to this note.