@misc{indiciae3f6fff06c86a, title = {TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding}, author = {Bozhi Luan and Hao Feng and Hong Chen and Yonghui Wang and Wengang Zhou and Houqiang Li}, year = {2024}, url = {https://arxiv.org/abs/2404.09797}, note = {Source identifier: 2404.09797} }