TY - RPRT TI - Semi-supervised reward learning for offline reinforcement learning AU - Ksenia Konyushkova AU - Konrad Zolna AU - Yusuf Aytar AU - Alexander Novikov AU - Scott Reed AU - Serkan Cabi AU - Nando de Freitas PY - 2020 UR - https://arxiv.org/abs/2012.06899 ID - 2012.06899 ER -