@misc{indiciae9dc6931c9925, title = {What is the Visual Cognition Gap between Humans and Multimodal LLMs?}, author = {Xu Cao and Yifan Shen and Bolin Lai and Wenqian Ye and Yunsheng Ma and Joerg Heintz and Jintai Chen and Meihuan Huang and Jianguo Cao and Aidong Zhang and James M. Rehg}, year = {2025}, url = {https://arxiv.org/abs/2406.10424}, note = {Source identifier: 2406.10424} }