@misc{indiciae1f912b037f4d, title = {ImageRef-VL: Enabling Contextual Image Referencing in Vision-Language Models}, author = {Jingwei Yi and Junhao Yin and Ju Xu and Peng Bao and Yongliang Wang and Wei Fan and Hao Wang}, year = {2025}, url = {https://arxiv.org/abs/2501.12418}, note = {Source identifier: 2501.12418} }