TY - RPRT TI - Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO AU - Yunze Tong AU - Mushui Liu AU - Canyu Zhao AU - Didi Zhu AU - Wanggui He AU - Shiyi Zhang AU - Hongwei Zhang AU - Peng Zhang AU - Jinlong Liu AU - Hao Jiang PY - 2026 UR - https://arxiv.org/abs/2602.06422 ID - 2602.06422 ER -