@misc{indiciaeabff0f917b9b, title = {Dynamic-LLaVA: Efficient Multimodal Large Language Models via Dynamic Vision-language Context Sparsification}, author = {Wenxuan Huang and Zijie Zhai and Yunhang Shen and Shaosheng Cao and Fei Zhao and Xiangfeng Xu and Zheyu Ye and Yao Hu and Shaohui Lin}, year = {2025}, url = {https://arxiv.org/abs/2412.00876}, note = {Source identifier: 2412.00876} }