@misc{indiciae01436c2da867, title = {MMInference: Accelerating Pre-filling for Long-Context VLMs via Modality-Aware Permutation Sparse Attention}, author = {Yucheng Li and Huiqiang Jiang and Chengruidong Zhang and Qianhui Wu and Xufang Luo and Surin Ahn and Amir H. Abdi and Dongsheng Li and Jianfeng Gao and Yuqing Yang and Lili Qiu}, year = {2025}, url = {https://arxiv.org/abs/2504.16083}, note = {Source identifier: 2504.16083} }