@misc{indiciae1b338ecffdda, title = {Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond}, author = {Jinze Bai and Shuai Bai and Shusheng Yang and Shijie Wang and Sinan Tan and Peng Wang and Junyang Lin and Chang Zhou and Jingren Zhou}, year = {2023}, url = {https://arxiv.org/abs/2308.12966}, note = {Source identifier: 2308.12966} }