@misc{indiciae914aed717f86, title = {3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models}, author = {Bin Yu and Shijie Lian and Xiaopeng Lin and Zhaolong Shen and Yuliang Wei and Haishan Liu and Changti Wu and Hang Yuan and Bailing Wang and Cong Huang and Kai Chen}, year = {2026}, url = {https://arxiv.org/abs/2603.24393}, note = {Source identifier: 2603.24393} }