TY - RPRT TI - R$^3$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification AU - Weijie Shi AU - Yanxi Chen AU - Zexi Li AU - Xuchen Pan AU - Yuchang Sun AU - Jiajie Xu AU - Xiaofang Zhou AU - Yaliang Li PY - 2026 UR - https://arxiv.org/abs/2601.03715 ID - 2601.03715 ER -