@misc{indiciae9ba0ec0b3fad, title = {TAP-VL: Text Layout-Aware Pre-training for Enriched Vision-Language Models}, author = {Jonathan Fhima and Elad Ben Avraham and Oren Nuriel and Yair Kittenplon and Roy Ganz and Aviad Aberdam and Ron Litman}, year = {2024}, url = {https://arxiv.org/abs/2411.04642}, note = {Source identifier: 2411.04642} }