@misc{indiciae9f7687444343, title = {MMFuser: Multimodal Multi-Layer Feature Fuser for Fine-Grained Vision-Language Understanding}, author = {Yue Cao and Yangzhou Liu and Zhe Chen and Guangchen Shi and Wenhai Wang and Danhuai Zhao and Tong Lu}, year = {2024}, url = {https://arxiv.org/abs/2410.11829}, note = {Source identifier: 2410.11829} }