@misc{indiciae716ad1a72c04, title = {Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners}, author = {Zhenhailong Wang and Manling Li and Ruochen Xu and Luowei Zhou and Jie Lei and Xudong Lin and Shuohang Wang and Ziyi Yang and Chenguang Zhu and Derek Hoiem and Shih-Fu Chang and Mohit Bansal and Heng Ji}, year = {2022}, url = {https://arxiv.org/abs/2205.10747}, note = {Source identifier: 2205.10747} }