@misc{indiciaefdd67e2bf195, title = {M3ET: Efficient Vision-Language Learning for Robotics based on Multimodal Mamba-Enhanced Transformer}, author = {Yanxin Zhang and Liang He and Zeyi Kang and Zuheng Ming and Kaixing Zhao}, year = {2025}, url = {https://arxiv.org/abs/2509.18005}, note = {Source identifier: 2509.18005} }