TY - RPRT TI - Mixed Policy Gradient: off-policy reinforcement learning driven jointly by data and model AU - Yang Guan AU - Jingliang Duan AU - Shengbo Eben Li AU - Jie Li AU - Jianyu Chen AU - Bo Cheng PY - 2024 UR - https://arxiv.org/abs/2102.11513 ID - 2102.11513 ER -