@misc{indiciaea96c6b2b2105, title = {AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding}, author = {Ahmed Masry and Juan A. Rodriguez and Tianyu Zhang and Suyuchen Wang and Chao Wang and Aarash Feizi and Akshay Kalkunte Suresh and Abhay Puri and Xiangru Jian and Pierre-André Noël and Sathwik Tejaswi Madhusudhan and Marco Pedersoli and Bang Liu and Nicolas Chapados and Yoshua Bengio and Enamul Hoque and Christopher Pal and Issam H. Laradji and David Vazquez and Perouz Taslakian and Spandana Gella and Sai Rajeswar}, year = {2025}, url = {https://arxiv.org/abs/2502.01341}, note = {Source identifier: 2502.01341} }