@misc{indiciaeec259e35b00d, title = {Speech2Action: Cross-modal Supervision for Action Recognition}, author = {Arsha Nagrani and Chen Sun and David Ross and Rahul Sukthankar and Cordelia Schmid and Andrew Zisserman}, year = {2020}, url = {https://arxiv.org/abs/2003.13594}, note = {Source identifier: 2003.13594} }