TY - RPRT TI - Axioms for Rational Reinforcement Learning AU - Peter Sunehag AU - Marcus Hutter PY - 2011 UR - https://arxiv.org/abs/1107.5520 ID - 1107.5520 ER -