@misc{indiciae5cee12bded74, title = {LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment}, author = {Bin Zhu and Bin Lin and Munan Ning and Yang Yan and Jiaxi Cui and HongFa Wang and Yatian Pang and Wenhao Jiang and Junwu Zhang and Zongwei Li and Wancai Zhang and Zhifeng Li and Wei Liu and Li Yuan}, year = {2024}, url = {https://arxiv.org/abs/2310.01852}, note = {Source identifier: 2310.01852} }