TY - RPRT TI - Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning AU - Botao Dong AU - Longyang Huang AU - Ning Pang AU - Hongtian Chen PY - 2026 UR - https://arxiv.org/abs/2608.02332 ID - 2608.02332 ER -