@misc{indiciaeca53280c0cb7, title = {Learning Contextual Tag Embeddings for Cross-Modal Alignment of Audio and Tags}, author = {Xavier Favory and Konstantinos Drossos and Tuomas Virtanen and Xavier Serra}, year = {2020}, url = {https://arxiv.org/abs/2010.14171}, note = {Source identifier: 2010.14171} }