@misc{indiciae0731f41646b2, title = {EVE: Towards End-to-End Video Subtitle Extraction with Vision-Language Models}, author = {Haiyang Yu and Mengyang Zhao and Jinghui Lu and Ke Niu and Yanjie Wang and Weijie Yin and Weitao Jia and Teng Fu and Yang Liu and Jun Liu and Hong Chen}, year = {2025}, url = {https://arxiv.org/abs/2503.04058}, note = {Source identifier: 2503.04058} }