TY - RPRT TI - Parallel $Q$-Learning: Scaling Off-policy Reinforcement Learning under Massively Parallel Simulation AU - Zechu Li AU - Tao Chen AU - Zhang-Wei Hong AU - Anurag Ajay AU - Pulkit Agrawal PY - 2023 UR - https://arxiv.org/abs/2307.12983 ID - 2307.12983 ER -