TY - RPRT TI - Beyond Image-Text Matching: Verb Understanding in Multimodal Transformers Using Guided Masking AU - Ivana Beňová AU - Jana Košecká AU - Michal Gregor AU - Martin Tamajka AU - Marcel Veselý AU - Marián Šimko PY - 2024 UR - https://arxiv.org/abs/2401.16575 ID - 2401.16575 ER -