multimodal
fact
neutral
Utility of visual intermediates for MLLMs is strongly task-conditioned, with gains concentrated in visual cue injection, grounding, and counterfactual state realization
we find that utility is strongly task-conditioned. Gains concentrate in visual cue injection, grounding, and counterfactual state realization
Computer Vision29 Aug 2026