@misc{indiciae205f3ad2c907, title = {Bridging Text and Video: A Universal Multimodal Transformer for Video-Audio Scene-Aware Dialog}, author = {Zekang Li and Zongjia Li and Jinchao Zhang and Yang Feng and Cheng Niu and Jie Zhou}, year = {2020}, url = {https://arxiv.org/abs/2002.00163}, note = {Source identifier: 2002.00163} }