multimodalfactbearishCLIP models exhibit a critical failure mode where irrelevant text in images confounds visual representations, biasing them toward lexical meaning rather than visual semanticsComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02494v1