@misc{indiciaec2f24a39ccc1, title = {LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models}, author = {Feng Li and Renrui Zhang and Hao Zhang and Yuanhan Zhang and Bo Li and Wei Li and Zejun Ma and Chunyuan Li}, year = {2024}, url = {https://arxiv.org/abs/2407.07895}, note = {Source identifier: 2407.07895} }