TY - RPRT TI - Structural Return Maximization for Reinforcement Learning AU - Joshua Joseph AU - Javier Velez AU - Nicholas Roy PY - 2014 UR - https://arxiv.org/abs/1405.2606 ID - 1405.2606 ER -