TY - RPRT TI - Text-Free Image-to-Speech Synthesis Using Learned Segmental Units AU - Wei-Ning Hsu AU - David Harwath AU - Christopher Song AU - James Glass PY - 2020 UR - https://arxiv.org/abs/2012.15454 ID - 2012.15454 ER -