TY - RPRT TI - Long N-step Surrogate Stage Reward to Reduce Variances of Deep Reinforcement Learning in Complex Problems AU - Junmin Zhong AU - Ruofan Wu AU - Jennie Si PY - 2022 UR - https://arxiv.org/abs/2210.04820 ID - 2210.04820 ER -