@misc{indiciae9772553d9ad7, title = {Cross-Modal and Hierarchical Modeling of Video and Text}, author = {Bowen Zhang and Hexiang Hu and Fei Sha}, year = {2018}, url = {https://arxiv.org/abs/1810.07212}, note = {Source identifier: 1810.07212} }