interpretability
fact
neutral
Fine-tuning and reinforcement learning often amplify behaviors that are already latent in pre-training
fine-tuning and RL often amplify behaviors already latent in pre-training
The Cognitive Revolution28 Aug 2026
fine-tuning and RL often amplify behaviors already latent in pre-training