TY - RPRT TI - Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement AU - Yunjian Zhang AU - Sudong Wang AU - Yang Li AU - Peiran Xu AU - Conghao Zhou AU - Xiaoyue Ma AU - Jianing Li AU - Yao Zhu PY - 2026 UR - https://arxiv.org/abs/2602.00815 ID - 2602.00815 ER -