@misc{indiciae65e9d2333c4e, title = {VTPerception-R1: Enhancing Multimodal Reasoning via Explicit Visual and Textual Perceptual Grounding}, author = {Yizhuo Ding and Mingkang Chen and Zhibang Feng and Tong Xiao and Wanying Qu and Wenqi Shao and Yanwei Fu}, year = {2025}, url = {https://arxiv.org/abs/2509.24776}, note = {Source identifier: 2509.24776} }