TY - RPRT TI - Directed Policy Gradient for Safe Reinforcement Learning with Human Advice AU - Hélène Plisnier AU - Denis Steckelmacher AU - Tim Brys AU - Diederik M. Roijers AU - Ann Nowé PY - 2018 UR - https://arxiv.org/abs/1808.04096 ID - 1808.04096 ER -