@misc{indiciae1e4c961bf7cf, title = {CoAVT: A Cognition-Inspired Unified Audio-Visual-Text Pre-Training Model for Multimodal Processing}, author = {Xianghu Yue and Xiaohai Tian and Lu Lu and Malu Zhang and Zhizheng Wu and Haizhou Li}, year = {2024}, url = {https://arxiv.org/abs/2401.12264}, note = {Source identifier: 2401.12264} }