TY - RPRT TI - Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion AU - Jiuhai Chen AU - Jianwei Yang AU - Haiping Wu AU - Dianqi Li AU - Jianfeng Gao AU - Tianyi Zhou AU - Bin Xiao PY - 2024 UR - https://arxiv.org/abs/2412.04424 ID - 2412.04424 ER -