TY - RPRT TI - From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models AU - Dongsheng Jiang AU - Yuchen Liu AU - Songlin Liu AU - Jin'e Zhao AU - Hao Zhang AU - Zhen Gao AU - Xiaopeng Zhang AU - Jin Li AU - Hongkai Xiong PY - 2024 UR - https://arxiv.org/abs/2310.08825 ID - 2310.08825 ER -