@misc{indiciaef95cc3931d4c, title = {A Joint Modeling of Vision-Language-Action for Target-oriented Grasping in Clutter}, author = {Kechun Xu and Shuqi Zhao and Zhongxiang Zhou and Zizhang Li and Huaijin Pi and Yue Wang and Rong Xiong}, year = {2024}, url = {https://arxiv.org/abs/2302.12610}, note = {Source identifier: 2302.12610} }