@misc{indiciae64c86d5eafd7, title = {Video-LLaVA: Learning United Visual Representation by Alignment Before Projection}, author = {Bin Lin and Yang Ye and Bin Zhu and Jiaxi Cui and Munan Ning and Peng Jin and Li Yuan}, year = {2024}, url = {https://arxiv.org/abs/2311.10122}, note = {Source identifier: 2311.10122} }