reasoningcritiquebearishReinforcement learning with verifiable rewards suffers from sparse feedback in molecular optimization tasksMachine Learning (Statistics)27 Jul 2026http://arxiv.org/abs/2607.00531v1