TY - RPRT TI - VISTA: A Visual and Textual Attention Dataset for Interpreting Multimodal Models AU - Harshit AU - Tolga Tasdizen PY - 2024 UR - https://arxiv.org/abs/2410.04609 ID - 2410.04609 ER -