@misc{indiciae593b380be099, title = {A Joint Study of Phrase Grounding and Task Performance in Vision and Language Models}, author = {Noriyuki Kojima and Hadar Averbuch-Elor and Yoav Artzi}, year = {2024}, url = {https://arxiv.org/abs/2309.02691}, note = {Source identifier: 2309.02691} }