@misc{indiciae8b80676a8304, title = {Leopard: A Vision Language Model For Text-Rich Multi-Image Tasks}, author = {Mengzhao Jia and Wenhao Yu and Kaixin Ma and Tianqing Fang and Zhihan Zhang and Siru Ouyang and Hongming Zhang and Dong Yu and Meng Jiang}, year = {2025}, url = {https://arxiv.org/abs/2410.01744}, note = {Source identifier: 2410.01744} }