@misc{indiciaeb27940dde9bd, title = {M2-CLIP: A Multimodal, Multi-task Adapting Framework for Video Action Recognition}, author = {Mengmeng Wang and Jiazheng Xing and Boyuan Jiang and Jun Chen and Jianbiao Mei and Xingxing Zuo and Guang Dai and Jingdong Wang and Yong Liu}, year = {2024}, url = {https://arxiv.org/abs/2401.11649}, note = {Source identifier: 2401.11649} }