@misc{indiciae31047247485f, title = {End-to-end Generative Pretraining for Multimodal Video Captioning}, author = {Paul Hongsuck Seo and Arsha Nagrani and Anurag Arnab and Cordelia Schmid}, year = {2022}, url = {https://arxiv.org/abs/2201.08264}, note = {Source identifier: 2201.08264} }