@misc{indiciaec4d9609ceb51, title = {R\textasciicircum{}3: Replay, Reflection, and Ranking Rewards for LLM Reinforcement Learning}, author = {Zhizheng Jiang and Kang Zhao and Weikai Xu and Xinkui Lin and Wei Liu and Jian Luan and Shuo Shang and Peng Han}, year = {2026}, url = {https://arxiv.org/abs/2601.19620}, note = {Source identifier: 2601.19620} }