multimodal
fact
neutral
Open World Object Detection systems built on multimodal foundation models suffer from semantic ambiguity due to unidirectional text-to-vision matching
Open World Object Detection (OWOD) built on multimodal foundation models often suffers from semantic ambiguity caused by unidirectional text-to-vision matching
Computer Vision30 Aug 2026