@misc{indiciae09e8e794ced7, title = {B-VLLM: A Vision Large Language Model with Balanced Spatio-Temporal Tokens}, author = {Zhuqiang Lu and Zhenfei Yin and Mengwei He and Zhihui Wang and Zicheng Liu and Zhiyong Wang and Kun Hu}, year = {2025}, url = {https://arxiv.org/abs/2412.09919}, note = {Source identifier: 2412.09919} }