TY - RPRT TI - A study of first-passage time minimization via Q-learning in heated gridworlds AU - M. A. Larchenko AU - P. Osinenko AU - G. Yaremenko AU - V. V. Palyulin PY - 2021 UR - https://arxiv.org/abs/2110.02129 ID - 2110.02129 ER -