multimodalcritiquebearishVLM robustness to spurious correlations remains poorly understood at scale despite CLIP-like models being foundational to multimodal systemsComputer Vision02 Aug 2026http://arxiv.org/abs/2607.28211v1