TY - RPRT TI - Stratified Experience Replay: Correcting Multiplicity Bias in Off-Policy Reinforcement Learning AU - Brett Daley AU - Cameron Hickert AU - Christopher Amato PY - 2021 UR - https://arxiv.org/abs/2102.11319 ID - 2102.11319 ER -