@misc{indiciae682f3d4f814a, title = {Watch, Listen, and Describe: Globally and Locally Aligned Cross-Modal Attentions for Video Captioning}, author = {Xin Wang and Yuan-Fang Wang and William Yang Wang}, year = {2018}, url = {https://arxiv.org/abs/1804.05448}, note = {Source identifier: 1804.05448} }