@misc{indiciaee76a6d16c014, title = {Cascaded Multilingual Audio-Visual Learning from Videos}, author = {Andrew Rouditchenko and Angie Boggust and David Harwath and Samuel Thomas and Hilde Kuehne and Brian Chen and Rameswar Panda and Rogerio Feris and Brian Kingsbury and Michael Picheny and James Glass}, year = {2021}, url = {https://arxiv.org/abs/2111.04823}, note = {Source identifier: 2111.04823} }