@misc{indiciaec93b997a1db8, title = {Learning Audio-Video Modalities from Image Captions}, author = {Arsha Nagrani and Paul Hongsuck Seo and Bryan Seybold and Anja Hauth and Santiago Manen and Chen Sun and Cordelia Schmid}, year = {2022}, url = {https://arxiv.org/abs/2204.00679}, note = {Source identifier: 2204.00679} }