@misc{indiciae9faa140a0b57, title = {VITA-VLA: Efficiently Teaching Vision-Language Models to Act via Action Expert Distillation}, author = {Shaoqi Dong and Chaoyou Fu and Haihan Gao and Yi-Fan Zhang and Chi Yan and Chu Wu and Xiaoyu Liu and Yunhang Shen and Jing Huo and Deqiang Jiang and Haoyu Cao and Yang Gao and Xing Sun and Ran He and Caifeng Shan}, year = {2025}, url = {https://arxiv.org/abs/2510.09607}, note = {Source identifier: 2510.09607} }