multimodalfactbearishState-of-the-art VLMs perform poorly on Visual Concept Inference from Sets (VICIS), often ignoring visual context or defaulting to biased generationsComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02402v1