@misc{indiciaea6e3cbb1bdec, title = {VoCap: Video Object Captioning and Segmentation from Any Prompt}, author = {Jasper Uijlings and Xingyi Zhou and Xiuye Gu and Arsha Nagrani and Anurag Arnab and Alireza Fathi and David Ross and Cordelia Schmid}, year = {2025}, url = {https://arxiv.org/abs/2508.21809}, note = {Source identifier: 2508.21809} }