general
fact
neutral
Rao-Blackwellized reveal lowers estimator variance for differentiable rewards and leave-one-out baseline works for non-differentiable rewards
we lower the estimator variance with a Rao-Blackwellized reveal for differentiable rewards and a leave-one-out baseline for non-differentiable ones
Machine Learning (Statistics)29 Aug 2026