TY - RPRT TI - Dropout Strategy in Reinforcement Learning: Limiting the Surrogate Objective Variance in Policy Optimization Methods AU - Zhengpeng Xie AU - Changdong Yu AU - Weizheng Qiao PY - 2023 UR - https://arxiv.org/abs/2310.20380 ID - 2310.20380 ER -