TY - RPRT TI - Preferred-Action-Optimized Diffusion Policies for Offline Reinforcement Learning AU - Tianle Zhang AU - Jiayi Guan AU - Lin Zhao AU - Yihang Li AU - Dongjiang Li AU - Zecui Zeng AU - Lei Sun AU - Yue Chen AU - Xuelong Wei AU - Lusong Li AU - Xiaodong He PY - 2024 UR - https://arxiv.org/abs/2405.18729 ID - 2405.18729 ER -