TY - RPRT TI - Towards Visual Text Grounding of Multimodal Large Language Model AU - Ming Li AU - Ruiyi Zhang AU - Jian Chen AU - Chenguang Wang AU - Jiuxiang Gu AU - Yufan Zhou AU - Franck Dernoncourt AU - Wanrong Zhu AU - Tianyi Zhou AU - Tong Sun PY - 2025 UR - https://arxiv.org/abs/2504.04974 ID - 2504.04974 ER -