@misc{indiciaed7bb40fd5be3, title = {3D-VLA: A 3D Vision-Language-Action Generative World Model}, author = {Haoyu Zhen and Xiaowen Qiu and Peihao Chen and Jincheng Yang and Xin Yan and Yilun Du and Yining Hong and Chuang Gan}, year = {2024}, url = {https://arxiv.org/abs/2403.09631}, note = {Source identifier: 2403.09631} }