@misc{indiciae3666440ec6c8, title = {Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement}, author = {Yunjian Zhang and Sudong Wang and Yang Li and Peiran Xu and Conghao Zhou and Xiaoyue Ma and Jianing Li and Yao Zhu}, year = {2026}, url = {https://arxiv.org/abs/2602.00815}, note = {Source identifier: 2602.00815} }