@misc{indiciae3df58d3bb7ca, title = {How Well Can Vision Language Models See Image Details?}, author = {Chenhui Gou and Abdulwahab Felemban and Faizan Farooq Khan and Deyao Zhu and Jianfei Cai and Hamid Rezatofighi and Mohamed Elhoseiny}, year = {2024}, url = {https://arxiv.org/abs/2408.03940}, note = {Source identifier: 2408.03940} }