TY - RPRT TI - Non-Deterministic Policy Improvement Stabilizes Approximated Reinforcement Learning AU - Wendelin Böhmer AU - Rong Guo AU - Klaus Obermayer PY - 2016 UR - https://arxiv.org/abs/1612.07548 ID - 1612.07548 ER -