TY - RPRT TI - Knowledge is reward: Learning optimal exploration by predictive reward cashing AU - Luca Ambrogioni PY - 2021 UR - https://arxiv.org/abs/2109.08518 ID - 2109.08518 ER -