@misc{indiciaee868db6da9cc, title = {Self-supervised Learning of Audio Representations from Audio-Visual Data using Spatial Alignment}, author = {Shanshan Wang and Archontis Politis and Annamaria Mesaros and Tuomas Virtanen}, year = {2022}, doi = {10.1109/jstsp.2022.3180592}, url = {https://arxiv.org/abs/2206.00970}, note = {Source identifier: 2206.00970} }