reasoningcritiquebearishAnswer-only supervised fine-tuning collapses multi-step reasoning in scientific reasoning tasksMachine Learning (Statistics)27 Jul 2026http://arxiv.org/abs/2607.00531v1