@misc{indiciae37b150e1f420, title = {ST\$\textasciicircum{}3\$: Accelerating Multimodal Large Language Model by Spatial-Temporal Visual Token Trimming}, author = {Jiedong Zhuang and Lu Lu and Ming Dai and Rui Hu and Jian Chen and Qiang Liu and Haoji Hu}, year = {2024}, url = {https://arxiv.org/abs/2412.20105}, note = {Source identifier: 2412.20105} }