@misc{indiciae388a2db8df84, title = {DEVICE: Depth and Visual Concepts Aware Transformer for OCR-based Image Captioning}, author = {Dongsheng Xu and Qingbao Huang and Xingmao Zhang and Haonan Cheng and Feng Shuang and Yi Cai}, year = {2025}, doi = {10.1016/j.patcog.2025.111522}, url = {https://arxiv.org/abs/2302.01540}, note = {Source identifier: 2302.01540} }