@misc{indiciae79934c92ab8e, title = {Referring Expressions as a Lens into Spatial Language Grounding in Vision-Language Models}, author = {Akshar Tumu and Varad Shinde and Parisa Kordjamshidi}, year = {2025}, url = {https://arxiv.org/abs/2511.06146}, note = {Source identifier: 2511.06146} }