TY - RPRT TI - Data-efficient Hindsight Off-policy Option Learning AU - Markus Wulfmeier AU - Dushyant Rao AU - Roland Hafner AU - Thomas Lampe AU - Abbas Abdolmaleki AU - Tim Hertweck AU - Michael Neunert AU - Dhruva Tirumala AU - Noah Siegel AU - Nicolas Heess AU - Martin Riedmiller PY - 2021 UR - https://arxiv.org/abs/2007.15588 ID - 2007.15588 ER -