@misc{indiciae0f990e42c174, title = {Connecting Vision and Language with Video Localized Narratives}, author = {Paul Voigtlaender and Soravit Changpinyo and Jordi Pont-Tuset and Radu Soricut and Vittorio Ferrari}, year = {2023}, url = {https://arxiv.org/abs/2302.11217}, note = {Source identifier: 2302.11217} }