@misc{indiciae0d755ee3f95c, title = {VLM Can Be a Good Assistant: Enhancing Embodied Visual Tracking with Self-Improving Vision-Language Models}, author = {Kui Wu and Shuhang Xu and Hao Chen and Churan Wang and Zhoujun Li and Yizhou Wang and Fangwei Zhong}, year = {2025}, url = {https://arxiv.org/abs/2505.20718}, note = {Source identifier: 2505.20718} }