@misc{indiciae4e015624233c, title = {Video-Teller: Enhancing Cross-Modal Generation with Fusion and Decoupling}, author = {Haogeng Liu and Qihang Fan and Tingkai Liu and Linjie Yang and Yunzhe Tao and Huaibo Huang and Ran He and Hongxia Yang}, year = {2023}, url = {https://arxiv.org/abs/2310.04991}, note = {Source identifier: 2310.04991} }