@misc{indiciaec0de1933678b, title = {Non-Deterministic Policy Improvement Stabilizes Approximated Reinforcement Learning}, author = {Wendelin Böhmer and Rong Guo and Klaus Obermayer}, year = {2016}, url = {https://arxiv.org/abs/1612.07548}, note = {Source identifier: 1612.07548} }