@misc{indiciaef084aace0be2, title = {Do Vision-Language Transformers Exhibit Visual Commonsense? An Empirical Study of VCR}, author = {Zhenyang Li and Yangyang Guo and Kejie Wang and Xiaolin Chen and Liqiang Nie and Mohan Kankanhalli}, year = {2024}, url = {https://arxiv.org/abs/2405.16934}, note = {Source identifier: 2405.16934} }