@misc{indiciae5d0eb95ce43a, title = {ReferDINO: Referring Video Object Segmentation with Visual Grounding Foundations}, author = {Tianming Liang and Kun-Yu Lin and Chaolei Tan and Jianguo Zhang and Wei-Shi Zheng and Jian-Fang Hu}, year = {2025}, url = {https://arxiv.org/abs/2501.14607}, note = {Source identifier: 2501.14607} }