TY - RPRT TI - Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning AU - Yibin Wang AU - Zhimin Li AU - Yuhang Zang AU - Yujie Zhou AU - Jiazi Bu AU - Chunyu Wang AU - Qinglin Lu AU - Cheng Jin AU - Jiaqi Wang PY - 2026 UR - https://arxiv.org/abs/2508.20751 ID - 2508.20751 ER -