@misc{indiciaeb64a4258c92e, title = {Vision-Language Models Struggle to Align Entities across Modalities}, author = {IƱigo Alonso and Gorka Azkune and Ander Salaberria and Jeremy Barnes and Oier Lopez de Lacalle}, year = {2025}, url = {https://arxiv.org/abs/2503.03854}, note = {Source identifier: 2503.03854} }