multimodal
fact
bullish
Integrating motion history, multi-person interactions, and object cues into a unified conditional diffusion framework enables more accurate forecasting of human movement in complex scenes
OCSD uses an object-conditioning mechanism that modulates denoising at every timestep, enabling fine-grained human-object reasoning, and a social encoder that models the interactions between all humans in the scene
Computer Vision30 Aug 2026