TY - RPRT TI - Safe and Efficient Off-Policy Reinforcement Learning AU - Rémi Munos AU - Tom Stepleton AU - Anna Harutyunyan AU - Marc G. Bellemare PY - 2016 UR - https://arxiv.org/abs/1606.02647 ID - 1606.02647 ER -