@misc{indiciaed2ed747b27e1, title = {Visual Language Tracking with Multi-modal Interaction: A Robust Benchmark}, author = {Xuchen Li and Shiyu Hu and Xiaokun Feng and Dailing Zhang and Meiqi Wu and Jing Zhang and Kaiqi Huang}, year = {2024}, url = {https://arxiv.org/abs/2409.08887}, note = {Source identifier: 2409.08887} }