@misc{indiciaea3c6fd0b2a6e, title = {VISA: Reasoning Video Object Segmentation via Large Language Models}, author = {Cilin Yan and Haochen Wang and Shilin Yan and Xiaolong Jiang and Yao Hu and Guoliang Kang and Weidi Xie and Efstratios Gavves}, year = {2024}, url = {https://arxiv.org/abs/2407.11325}, note = {Source identifier: 2407.11325} }