multimodalcritiquebearishExisting caption metrics focus on flat textual outputs and fail to reliably assess multimodal attributes in structured audio descriptions.Computation and Language29 Jul 2026http://arxiv.org/abs/2607.21424v1