@misc{indiciae481db5aa7115, title = {VISTA: Enhancing Visual Conditioning via Track-Following Preference Optimization in Vision-Language-Action Models}, author = {Yiye Chen and Yanan Jian and Xiaoyi Dong and Shuxin Cao and Jing Wu and Patricio Vela and Benjamin E. Lundell and Dongdong Chen}, year = {2026}, url = {https://arxiv.org/abs/2602.05049}, note = {Source identifier: 2602.05049} }