TY - RPRT TI - SPEECH-COCO: 600k Visually Grounded Spoken Captions Aligned to MSCOCO Data Set AU - William Havard AU - Laurent Besacier AU - Olivier Rosec PY - 2020 DO - 10.21437/glu.2017-9 UR - https://arxiv.org/abs/1707.08435 ID - 1707.08435 ER -