@misc{indiciaee7d5fa625fde, title = {Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models}, author = {Haoran Wei and Lingyu Kong and Jinyue Chen and Liang Zhao and Zheng Ge and Jinrong Yang and Jianjian Sun and Chunrui Han and Xiangyu Zhang}, year = {2023}, url = {https://arxiv.org/abs/2312.06109}, note = {Source identifier: 2312.06109} }