rlhffactbearishSFT- and GRPO-based self-evolution methods suffer from out-of-domain performance degradationMachine Learning27 Jul 2026http://arxiv.org/abs/2607.02460v1