@misc{indiciae414cae5423c7, title = {Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision}, author = {Xiaofeng Han and Shunpeng Chen and Zenghuang Fu and Zhe Feng and Lue Fan and Dong An and Changwei Wang and Li Guo and Weiliang Meng and Xiaopeng Zhang and Rongtao Xu and Shibiao Xu}, year = {2025}, doi = {10.1016/j.inffus.2025.103652}, url = {https://arxiv.org/abs/2504.02477}, note = {Source identifier: 2504.02477} }