interpretability
fact
bearish
Hidden coordinates in language models are not uniquely determined by the input-output function, making representation measurements non-invariant to function-preserving basis changes
Hidden coordinates are not uniquely determined by a language model's input--output function, so representation-derived measurements should be invariant to function-preserving changes of basis.
Machine Learning (Statistics)29 Aug 2026