TY - RPRT TI - AlignVLM: Bridging Vision and Language Latent Spaces for Multimodal Document Understanding AU - Ahmed Masry AU - Juan A. Rodriguez AU - Tianyu Zhang AU - Suyuchen Wang AU - Chao Wang AU - Aarash Feizi AU - Akshay Kalkunte Suresh AU - Abhay Puri AU - Xiangru Jian AU - Pierre-André Noël AU - Sathwik Tejaswi Madhusudhan AU - Marco Pedersoli AU - Bang Liu AU - Nicolas Chapados AU - Yoshua Bengio AU - Enamul Hoque AU - Christopher Pal AU - Issam H. Laradji AU - David Vazquez AU - Perouz Taslakian AU - Spandana Gella AU - Sai Rajeswar PY - 2025 UR - https://arxiv.org/abs/2502.01341 ID - 2502.01341 ER -