multimodalfactbullishSpeechMapper enables learning speech-to-LLM embedding projectors using only ASR data, improving upon previous multi-stage training pipelinesComputation and Language27 Jul 2026http://arxiv.org/abs/2607.01960v1