@misc{indiciae4fe2a946bd22, title = {Fine-grained Visual Textual Alignment for Cross-Modal Retrieval using Transformer Encoders}, author = {Nicola Messina and Giuseppe Amato and Andrea Esuli and Fabrizio Falchi and Claudio Gennaro and Stéphane Marchand-Maillet}, year = {2021}, url = {https://arxiv.org/abs/2008.05231}, note = {Source identifier: 2008.05231} }