multimodalfactbullishVideo world models can maintain persistent dynamic object memory by using LLMs to coordinate 3D trajectories with camera movements as control signalsComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02517v1