TY - RPRT TI - Behavior-Regularized Diffusion Policy Optimization for Offline Reinforcement Learning AU - Chen-Xiao Gao AU - Chenyang Wu AU - Mingjun Cao AU - Chenjun Xiao AU - Yang Yu AU - Zongzhang Zhang PY - 2025 UR - https://arxiv.org/abs/2502.04778 ID - 2502.04778 ER -