@misc{indiciaec870e0174537, title = {COOT: Cooperative Hierarchical Transformer for Video-Text Representation Learning}, author = {Simon Ging and Mohammadreza Zolfaghari and Hamed Pirsiavash and Thomas Brox}, year = {2020}, url = {https://arxiv.org/abs/2011.00597}, note = {Source identifier: 2011.00597} }