@misc{indiciaeeedfaab008bf, title = {LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models}, author = {Yanwei Li and Chengyao Wang and Jiaya Jia}, year = {2023}, url = {https://arxiv.org/abs/2311.17043}, note = {Source identifier: 2311.17043} }