@misc{indiciae40a5ebca881d, title = {Structured Video-Language Modeling with Temporal Grouping and Spatial Grounding}, author = {Yuanhao Xiong and Long Zhao and Boqing Gong and Ming-Hsuan Yang and Florian Schroff and Ting Liu and Cho-Jui Hsieh and Liangzhe Yuan}, year = {2024}, url = {https://arxiv.org/abs/2303.16341}, note = {Source identifier: 2303.16341} }