TY - RPRT TI - Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards AU - Zijing Hu AU - Fengda Zhang AU - Long Chen AU - Kun Kuang AU - Jiahui Li AU - Kaifeng Gao AU - Jun Xiao AU - Xin Wang AU - Wenwu Zhu PY - 2025 UR - https://arxiv.org/abs/2503.11240 ID - 2503.11240 ER -