@misc{indiciae1acc7b9da68d, title = {VILA: On Pre-training for Visual Language Models}, author = {Ji Lin and Hongxu Yin and Wei Ping and Yao Lu and Pavlo Molchanov and Andrew Tao and Huizi Mao and Jan Kautz and Mohammad Shoeybi and Song Han}, year = {2024}, url = {https://arxiv.org/abs/2312.07533}, note = {Source identifier: 2312.07533} }