multimodalcritiquebearishThe literature on foundation models for hand-object interaction remains fragmented, with studies typically describing methods simply as 'using large models' without systematic characterizationComputer Vision02 Aug 2026http://arxiv.org/abs/2607.28394v1