interpretability
critique
bearish
Existing work on LLM self-explanation faithfulness focuses on evaluation or inference-time prompting but does not provide a mechanism to directly optimize model parameters for faithful self-explanations
Machine Learning28 Jul 2026