TY - RPRT TI - VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models AU - Hao Wang AU - Xiaobao Wei AU - Jingyang He AU - Chengyu Bai AU - Chun-Kai Fan AU - Jiajun Cao AU - Jintao Chen AU - Ying Li AU - Shanyu Rong AU - Ming Lu AU - Xiaozhu Ju AU - Jian Tang AU - Shanghang Zhang PY - 2026 UR - https://arxiv.org/abs/2605.10485 ID - 2605.10485 ER -