@misc{indiciae24b8fb870443, title = {Emergent Visual Grounding in Large Multimodal Models Without Grounding Supervision}, author = {Shengcao Cao and Liang-Yan Gui and Yu-Xiong Wang}, year = {2025}, url = {https://arxiv.org/abs/2410.08209}, note = {Source identifier: 2410.08209} }