@misc{indiciae8744fe040234, title = {From Image to Video, what do we need in multimodal LLMs?}, author = {Suyuan Huang and Haoxin Zhang and Linqing Zhong and Honggu Chen and Yan Gao and Yao Hu and Zengchang Qin}, year = {2025}, url = {https://arxiv.org/abs/2404.11865}, note = {Source identifier: 2404.11865} }