TY - RPRT TI - Avoiding Wireheading with Value Reinforcement Learning AU - Tom Everitt AU - Marcus Hutter PY - 2016 UR - https://arxiv.org/abs/1605.03143 ID - 1605.03143 ER -