multimodalfactbearishCollecting diverse egocentric data across scenes, objects, motions, and embodiments remains costly for embodied AIComputer Vision02 Aug 2026http://arxiv.org/abs/2607.28243v1