@misc{indiciae58dc2c1d04b7, title = {R\$\textasciicircum{}3\$L: Reflect-then-Retry Reinforcement Learning with Language-Guided Exploration, Pivotal Credit, and Positive Amplification}, author = {Weijie Shi and Yanxi Chen and Zexi Li and Xuchen Pan and Yuchang Sun and Jiajie Xu and Xiaofang Zhou and Yaliang Li}, year = {2026}, url = {https://arxiv.org/abs/2601.03715}, note = {Source identifier: 2601.03715} }