@misc{indiciae0a57084fcc2c, title = {LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos}, author = {Tiantian Geng and Jinrui Zhang and Qingni Wang and Teng Wang and Jinming Duan and Feng Zheng}, year = {2025}, url = {https://arxiv.org/abs/2411.19772}, note = {Source identifier: 2411.19772} }