TY - RPRT TI - MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation AU - Yang Liu AU - Pengxiang Ding AU - Tengyue Jiang AU - Xudong Wang AU - Wenxuan Song AU - Minghui Lin AU - Han Zhao AU - Hongyin Zhang AU - Zifeng Zhuang AU - Wei Zhao AU - Siteng Huang AU - Jinkui Shi AU - Donglin Wang PY - 2026 UR - https://arxiv.org/abs/2603.25406 ID - 2603.25406 ER -