@misc{indiciae0c8d7657c3e5, title = {VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models}, author = {Hao Wang and Xiaobao Wei and Jingyang He and Chengyu Bai and Chun-Kai Fan and Jiajun Cao and Jintao Chen and Ying Li and Shanyu Rong and Ming Lu and Xiaozhu Ju and Jian Tang and Shanghang Zhang}, year = {2026}, url = {https://arxiv.org/abs/2605.10485}, note = {Source identifier: 2605.10485} }