@misc{indiciaec3b02b5cabdc, title = {Siamese Vision Transformers are Scalable Audio-visual Learners}, author = {Yan-Bo Lin and Gedas Bertasius}, year = {2024}, url = {https://arxiv.org/abs/2403.19638}, note = {Source identifier: 2403.19638} }