multimodalcritiquebearishSelective localization of user-specified sounds in multi-source scenes remains challenging for current deep learning systemsArtificial Intelligence27 Jul 2026http://arxiv.org/abs/2607.02343v1