TY - RPRT TI - Diffusion-based Reinforcement Learning via Q-weighted Variational Policy Optimization AU - Shutong Ding AU - Ke Hu AU - Zhenhao Zhang AU - Kan Ren AU - Weinan Zhang AU - Jingyi Yu AU - Jingya Wang AU - Ye Shi PY - 2024 UR - https://arxiv.org/abs/2405.16173 ID - 2405.16173 ER -