@misc{indiciae4a5b0c7ee378, title = {VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks}, author = {Jiannan Wu and Muyan Zhong and Sen Xing and Zeqiang Lai and Zhaoyang Liu and Zhe Chen and Wenhai Wang and Xizhou Zhu and Lewei Lu and Tong Lu and Ping Luo and Yu Qiao and Jifeng Dai}, year = {2024}, url = {https://arxiv.org/abs/2406.08394}, note = {Source identifier: 2406.08394} }