@misc{indiciaeb19391141c40, title = {VL-GPT: A Generative Pre-trained Transformer for Vision and Language Understanding and Generation}, author = {Jinguo Zhu and Xiaohan Ding and Yixiao Ge and Yuying Ge and Sijie Zhao and Hengshuang Zhao and Xiaohua Wang and Ying Shan}, year = {2023}, url = {https://arxiv.org/abs/2312.09251}, note = {Source identifier: 2312.09251} }