@misc{indiciae7ae615a9bede, title = {Constructing Multilingual Visual-Text Datasets Revealing Visual Multilingual Ability of Vision Language Models}, author = {Jesse Atuhurra and Iqra Ali and Tatsuya Hiraoka and Hidetaka Kamigaito and Tomoya Iwakura and Taro Watanabe}, year = {2024}, url = {https://arxiv.org/abs/2406.15359}, note = {Source identifier: 2406.15359} }