roboticsfactbullishPolicy-paced learning can regulate synthetic-data training through sample selection and scheduling to balance world-model quality with policy improvement in robot RLArtificial Intelligence27 Jul 2026http://arxiv.org/abs/2607.02431v1