@misc{indiciae694b2a639977, title = {Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning}, author = {Wenhao Zhang and Yibo Xie and Rui Wang and Jiahua Yang and Lei Jiang and Zibo Yang and Yawei Wang and Jiali Xu and jasperawang and Haoyang Long and Huan Xiong and alantzhao}, year = {2026}, url = {https://arxiv.org/abs/2608.01418}, note = {Source identifier: 2608.01418} }