@misc{indiciae73c9c88d562e, title = {Beyond Image-Text Matching: Verb Understanding in Multimodal Transformers Using Guided Masking}, author = {Ivana Beňová and Jana Košecká and Michal Gregor and Martin Tamajka and Marcel Veselý and Marián Šimko}, year = {2024}, url = {https://arxiv.org/abs/2401.16575}, note = {Source identifier: 2401.16575} }