interpretabilityfactbullishReinforcement learning can directly optimize models to generate faithful self-explanations by modifying faithfulness metrics into training objectivesMachine Learning28 Jul 2026http://arxiv.org/abs/2607.21090v1