rlhffactbullishPrefReward outperforms non-personalized and retrieval-based baselines in both generation quality and personalization interpretability on the LongLaMP datasetComputation and Language28 Jul 2026http://arxiv.org/abs/2607.21067v1