multimodalfactbullishTraining-free approaches using foundation models like SAM can reformulate object counting as a prompt-driven segmentation task, eliminating the need for costly counting-specific training dataComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02139v1