TY - RPRT TI - Intentionally-underestimated Value Function at Terminal State for Temporal-difference Learning with Mis-designed Reward AU - Taisuke Kobayashi PY - 2023 DO - 10.1016/j.rico.2025.100530 UR - https://arxiv.org/abs/2308.12772 ID - 2308.12772 ER -