TY - RPRT TI - Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding AU - Liping Yuan AU - Jiawei Wang AU - Haomiao Sun AU - Yuchen Zhang AU - Yuan Lin PY - 2025 UR - https://arxiv.org/abs/2501.07888 ID - 2501.07888 ER -