TY - RPRT TI - Data-regularized Reinforcement Learning for Diffusion Models at Scale AU - Haotian Ye AU - Kaiwen Zheng AU - Jiashu Xu AU - Puheng Li AU - Huayu Chen AU - Jiaqi Han AU - Sheng Liu AU - Qinsheng Zhang AU - Hanzi Mao AU - Zekun Hao AU - Prithvijit Chattopadhyay AU - Dinghao Yang AU - Liang Feng AU - Maosheng Liao AU - Junjie Bai AU - Ming-Yu Liu AU - James Zou AU - Stefano Ermon PY - 2025 UR - https://arxiv.org/abs/2512.04332 ID - 2512.04332 ER -