TY - RPRT TI - 3DVLA: Enhancing Vision-Language-Action Models via 3D Spatial and Instance Understanding AU - Zhongyu Xia AU - Yousen Tang AU - Bingqing Wei AU - Yongtao Wang PY - 2026 UR - https://arxiv.org/abs/2605.29416 ID - 2605.29416 ER -