@misc{indiciaec0090c9786a7, title = {VLCap: Vision-Language with Contrastive Learning for Coherent Video Paragraph Captioning}, author = {Kashu Yamazaki and Sang Truong and Khoa Vo and Michael Kidd and Chase Rainwater and Khoa Luu and Ngan Le}, year = {2022}, url = {https://arxiv.org/abs/2206.12972}, note = {Source identifier: 2206.12972} }