TY - RPRT TI - Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR AU - Zhenyang Li AU - Yangyang Guo AU - Kejie Wang AU - Xiaolin Chen AU - Liqiang Nie AU - Mohan Kankanhalli PY - 2024 UR - https://arxiv.org/abs/2405.16934 ID - 2405.16934 ER -