@misc{indiciae9a2e1dc547ad, title = {VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models}, author = {Zixuan Wang and Yuxin Chen and Yuqi Liu and Jinhui Ye and Pengguang Chen and Changsheng Lu and Shu Liu and Bei Yu and Jiaya Jia}, year = {2026}, url = {https://arxiv.org/abs/2603.22003}, note = {Source identifier: 2603.22003} }