@misc{indiciae921aa14f935f, title = {CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning}, author = {Ankan Deria and Komal Kumar and Xilin He and Imran Razzak and Hisham Cholakkal and Fahad Shahbaz Khan and Salman Khan}, year = {2026}, url = {https://arxiv.org/abs/2604.03231}, note = {Source identifier: 2604.03231} }