multimodalfactbullishStructured motion representations that separate meaningful object dynamics from camera-induced variation can be recovered from frozen features of a pretrained image vision transformerComputer Vision29 Jul 2026http://arxiv.org/abs/2607.21576v1