@misc{indiciaeffb3fb8aea2c, title = {RoboRefer: Towards Spatial Referring with Reasoning in Vision-Language Models for Robotics}, author = {Enshen Zhou and Jingkun An and Cheng Chi and Yi Han and Shanyu Rong and Chi Zhang and Pengwei Wang and Zhongyuan Wang and Tiejun Huang and Lu Sheng and Shanghang Zhang}, year = {2026}, url = {https://arxiv.org/abs/2506.04308}, note = {Source identifier: 2506.04308} }