TY - RPRT TI - R^3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning AU - Zhizheng Jiang AU - Kang Zhao AU - Weikai Xu AU - Xinkui Lin AU - Wei Liu AU - Jian Luan AU - Shuo Shang AU - Peng Han PY - 2026 UR - https://arxiv.org/abs/2601.19620 ID - 2601.19620 ER -