TY - RPRT TI - A Stochastic Maximum Principle Approach for Reinforcement Learning with Parameterized Environment AU - Richard Archibald AU - Feng Bao AU - Jiongmin Yong PY - 2023 DO - 10.1016/j.jcp.2023.112238 UR - https://arxiv.org/abs/2208.02241 ID - 2208.02241 ER -