TY - RPRT TI - Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning AU - Xu Wan AU - Yansheng Wang AU - Wenqi Huang AU - Mingyang Sun PY - 2026 UR - https://arxiv.org/abs/2602.20722 ID - 2602.20722 ER -