multimodalfactbullishStrong visual priors from pretrained diffusion models are sufficient to bridge domain gaps introduced by disjoint training sources for unified scene understandingComputer Vision29 Jul 2026http://arxiv.org/abs/2607.21592v1