@misc{indiciae9ba6b6ec212a, title = {Efficient Multi-modal Large Language Models via Visual Token Grouping}, author = {Minbin Huang and Runhui Huang and Han Shi and Yimeng Chen and Chuanyang Zheng and Xiangguo Sun and Xin Jiang and Zhenguo Li and Hong Cheng}, year = {2024}, url = {https://arxiv.org/abs/2411.17773}, note = {Source identifier: 2411.17773} }