@misc{indiciae1d16b2f92b70, title = {Towards Better Alignment: Training Diffusion Models with Reinforcement Learning Against Sparse Rewards}, author = {Zijing Hu and Fengda Zhang and Long Chen and Kun Kuang and Jiahui Li and Kaifeng Gao and Jun Xiao and Xin Wang and Wenwu Zhu}, year = {2025}, url = {https://arxiv.org/abs/2503.11240}, note = {Source identifier: 2503.11240} }