multimodalfactbullishA minimalist pixel-space Diffusion Transformer trained from scratch surpasses complex latent-based diffusion models for 3D reconstructionComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02515v1