@misc{indiciae5b983820aa2c, title = {Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning}, author = {Xu Wan and Yansheng Wang and Wenqi Huang and Mingyang Sun}, year = {2026}, url = {https://arxiv.org/abs/2602.20722}, note = {Source identifier: 2602.20722} }