TY - RPRT TI - Stable deep reinforcement learning method by predicting uncertainty in rewards as a subtask AU - Kanata Suzuki AU - Tetsuya Ogata PY - 2021 DO - 10.1007/978-3-030-63833-7_55 UR - https://arxiv.org/abs/2101.06906 ID - 2101.06906 ER -