@misc{indiciaed5c482dc6c31, title = {Towards Visual Text Grounding of Multimodal Large Language Model}, author = {Ming Li and Ruiyi Zhang and Jian Chen and Chenguang Wang and Jiuxiang Gu and Yufan Zhou and Franck Dernoncourt and Wanrong Zhu and Tianyi Zhou and Tong Sun}, year = {2025}, url = {https://arxiv.org/abs/2504.04974}, note = {Source identifier: 2504.04974} }