@misc{indiciae9e4d0be08321, title = {X-DiffVLA: X-Embodied Diffusion Action Heads for Vision-Language-Action Models}, author = {Boyu Li and Chaoyi Xu and Haoqi Yuan and Xinrun Xu and Börje F. Karlsson and Haoran Li and Zongqing Lu and Dongbin Zhao}, year = {2026}, url = {https://arxiv.org/abs/2605.25044}, note = {Source identifier: 2605.25044} }