TY - RPRT TI - VX2TEXT: End-to-End Learning of Video-Based Text Generation From Multimodal Inputs AU - Xudong Lin AU - Gedas Bertasius AU - Jue Wang AU - Shih-Fu Chang AU - Devi Parikh AU - Lorenzo Torresani PY - 2021 UR - https://arxiv.org/abs/2101.12059 ID - 2101.12059 ER -