TY - RPRT TI - Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions AU - Juergen Schmidhuber PY - 2020 UR - https://arxiv.org/abs/1912.02875 ID - 1912.02875 ER -