rlhffactbearishOver-optimization leads to reward hacking, sycophancy, and verbosity in language modelsNathan Lambert26 Jul 2026https://x.com/natolambert/status/2081018219746468088