@misc{indiciae9171ab1164af, title = {VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset}, author = {Jing Liu and Sihan Chen and Xingjian He and Longteng Guo and Xinxin Zhu and Weining Wang and Jinhui Tang}, year = {2025}, url = {https://arxiv.org/abs/2304.08345}, note = {Source identifier: 2304.08345} }