multimodalfactbullishLarge Language Models have demonstrated remarkable capabilities in 3D indoor synthesis for Manhattan environmentsComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02407v1