TY - RPRT TI - E-GRPO: High Entropy Steps Drive Effective Reinforcement Learning for Flow Models AU - Shengjun Zhang AU - Zhang Zhang AU - Chensheng Dai AU - Yueqi Duan PY - 2026 UR - https://arxiv.org/abs/2601.00423 ID - 2601.00423 ER -