@misc{indiciaea104e17ae5e2, title = {Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models}, author = {Jiachen Jiang and Jinxin Zhou and Bo Peng and Xia Ning and Zhihui Zhu}, year = {2025}, url = {https://arxiv.org/abs/2505.17316}, note = {Source identifier: 2505.17316} }