multimodalcritiquebearishMost existing 3D-QA methods rely on costly 3D-specific training or fine-tuning with annotations, limiting their scalability and real-world applicabilityComputer Vision02 Aug 2026http://arxiv.org/abs/2607.28442v1