@misc{indiciaee80217308adb, title = {CoF: Coarse to Fine-Grained Image Understanding for Multi-modal Large Language Models}, author = {Yeyuan Wang and Dehong Gao and Bin Li and Rujiao Long and Lei Yi and Xiaoyan Cai and Libin Yang and Jinxia Zhang and Shanqing Yu and Qi Xuan}, year = {2024}, url = {https://arxiv.org/abs/2412.16869}, note = {Source identifier: 2412.16869} }