@misc{indiciaee015bb753917, title = {Describe Anything Model for Visual Question Answering on Text-rich Images}, author = {Yen-Linh Vu and Dinh-Thang Duong and Truong-Binh Duong and Anh-Khoi Nguyen and Thanh-Huy Nguyen and Le Thien Phuc Nguyen and Jianhua Xing and Xingjian Li and Tianyang Wang and Ulas Bagci and Min Xu}, year = {2025}, doi = {10.1109/iccvw69036.2025.00776}, url = {https://arxiv.org/abs/2507.12441}, note = {Source identifier: 2507.12441} }