@misc{indiciaeb52a352366fa, title = {StrucTexTv3: An Efficient Vision-Language Model for Text-rich Image Perception, Comprehension, and Beyond}, author = {Pengyuan Lyu and Yulin Li and Hao Zhou and Weihong Ma and Xingyu Wan and Qunyi Xie and Liang Wu and Chengquan Zhang and Kun Yao and Errui Ding and Jingdong Wang}, year = {2024}, url = {https://arxiv.org/abs/2405.21013}, note = {Source identifier: 2405.21013} }