@misc{indiciae33286d560992, title = {Vision Transformers are Parameter-Efficient Audio-Visual Learners}, author = {Yan-Bo Lin and Yi-Lin Sung and Jie Lei and Mohit Bansal and Gedas Bertasius}, year = {2023}, url = {https://arxiv.org/abs/2212.07983}, note = {Source identifier: 2212.07983} }