@misc{indiciaecce7d2281009, title = {Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers}, author = {Vidhi Jain and Maria Attarian and Nikhil J Joshi and Ayzaan Wahid and Danny Driess and Quan Vuong and Pannag R Sanketi and Pierre Sermanet and Stefan Welker and Christine Chan and Igor Gilitschenski and Yonatan Bisk and Debidatta Dwibedi}, year = {2024}, url = {https://arxiv.org/abs/2403.12943}, note = {Source identifier: 2403.12943} }