reasoningfactbullishActive-GRPO enables policies to actively decide when to imitate references versus reinforce their own discoveries, overcoming reference quality ceilingsMachine Learning (Statistics)27 Jul 2026http://arxiv.org/abs/2607.00531v1