@misc{indiciae3fd1cd4e6958, title = {Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models}, author = {Wei Wang and Zhaowei Li and Qi Xu and Linfeng Li and YiQing Cai and Botian Jiang and Hang Song and Xingcan Hu and Pengyu Wang and Li Xiao}, year = {2024}, url = {https://arxiv.org/abs/2411.09691}, note = {Source identifier: 2411.09691} }