TY - RPRT TI - GenPO: Generative Diffusion Models Meet On-Policy Reinforcement Learning AU - Shutong Ding AU - Ke Hu AU - Shan Zhong AU - Haoyang Luo AU - Weinan Zhang AU - Jingya Wang AU - Jun Wang AU - Ye Shi PY - 2026 UR - https://arxiv.org/abs/2505.18763 ID - 2505.18763 ER -