@misc{indiciaecc49b3e81279, title = {Alleviating Sparse Rewards by Modeling Step-Wise and Long-Term Sampling Effects in Flow-Based GRPO}, author = {Yunze Tong and Mushui Liu and Canyu Zhao and Didi Zhu and Wanggui He and Shiyi Zhang and Hongwei Zhang and Peng Zhang and Jinlong Liu and Hao Jiang}, year = {2026}, url = {https://arxiv.org/abs/2602.06422}, note = {Source identifier: 2602.06422} }