TY - RPRT TI - Watch, Listen, and Describe: Globally and Locally Aligned Cross-Modal Attentions for Video Captioning AU - Xin Wang AU - Yuan-Fang Wang AU - William Yang Wang PY - 2018 UR - https://arxiv.org/abs/1804.05448 ID - 1804.05448 ER -