@misc{indiciae5a939e10025c, title = {WaveTransformer: A Novel Architecture for Audio Captioning Based on Learning Temporal and Time-Frequency Information}, author = {An Tran and Konstantinos Drossos and Tuomas Virtanen}, year = {2020}, url = {https://arxiv.org/abs/2010.11098}, note = {Source identifier: 2010.11098} }