roboticsfactbullishCamera motion can be mined from egocentric video to provide multi-intention supervision for language-conditioned viewpoint predictionMachine Learning27 Jul 2026http://arxiv.org/abs/2607.02417v1