@misc{indiciaed73a8c133aec, title = {GeM-VG: Towards Generalized Multi-image Visual Grounding with Multimodal Large Language Models}, author = {Shurong Zheng and Yousong Zhu and Hongyin Zhao and Fan Yang and Yufei Zhan and Ming Tang and Jinqiao Wang}, year = {2026}, url = {https://arxiv.org/abs/2601.04777}, note = {Source identifier: 2601.04777} }