multimodalfactbullishFlowCIR offers computationally efficient training by operating on pre-extracted VLM embeddings and training only a small transport module without updating encodersComputer Vision27 Jul 2026http://arxiv.org/abs/2607.02284v1