@misc{indiciaea38647adfdbf, title = {FILA: Fine-Grained Vision Language Models}, author = {Shiding Zhu and Wenhui Dong and Jun Song and Yingbo Wang and Yanan Guo and Bo Zheng}, year = {2025}, url = {https://arxiv.org/abs/2412.08378}, note = {Source identifier: 2412.08378} }