@misc{indiciae37261bfe1208, title = {Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models}, author = {Shimin Chen and Yitian Yuan and Shaoxiang Chen and Zequn Jie and Lin Ma}, year = {2024}, url = {https://arxiv.org/abs/2406.08024}, note = {Source identifier: 2406.08024} }