multimodal
fact
bullish
EndoCLIP foundation model trained on 125,756 lesion-level image-text pairs from routine colonoscopy reports outperforms general-purpose and biomedical vision-language encoders across multiple clinical tasks
Artificial Intelligence02 Aug 2026