@misc{indiciae88a7124e5b6b, title = {VEGA: Learning Interleaved Image-Text Comprehension in Vision-Language Large Models}, author = {Chenyu Zhou and Mengdan Zhang and Peixian Chen and Chaoyou Fu and Yunhang Shen and Xiawu Zheng and Xing Sun and Rongrong Ji}, year = {2024}, url = {https://arxiv.org/abs/2406.10228}, note = {Source identifier: 2406.10228} }