TY - RPRT TI - GPU-Parallel Multi-Task Reinforcement Learning with Demonstration Guided Policy Optimization AU - Rui Zhang AU - Qiwei Wu AU - Zhengyu Zhang AU - Tao Li AU - Yunrong Guo AU - Junjie Lai AU - Renjing Xu AU - Weihua Zhang PY - 2026 UR - https://arxiv.org/abs/2606.03335 ID - 2606.03335 ER -