@misc{indiciae0bd43322f8c6, title = {One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting}, author = {Rui Tang and Wentao Yang and Peirong Zhang and Yongxin Shi and Shun Zhang and Huiguo He and Lianwen Jin}, year = {2026}, doi = {10.1145/3767308.3835174}, url = {https://arxiv.org/abs/2607.27902}, note = {Source identifier: 2607.27902} }