@misc{indiciae83a133be4961, title = {Learning Grounded Vision-Language Representation for Versatile Understanding in Untrimmed Videos}, author = {Teng Wang and Jinrui Zhang and Feng Zheng and Wenhao Jiang and Ran Cheng and Ping Luo}, year = {2023}, url = {https://arxiv.org/abs/2303.06378}, note = {Source identifier: 2303.06378} }