@misc{indiciaeabb58b6e9829, title = {Temporal Gains, Spatial Costs: Revisiting Video Fine-Tuning in Multimodal Large Language Models}, author = {Linghao Zhang and Jungang Li and Yonghua Hei and Sicheng Tao and Song Dai and Yibo Yan and Zihao Dongfang and Weiting Liu and Chenxi Qin and Hanqian Li and Xin Zou and Jiahao Zhang and Shuhang Xun and Haiyun Jiang and Xuming Hu}, year = {2026}, url = {https://arxiv.org/abs/2603.17541}, note = {Source identifier: 2603.17541} }