TY - RPRT TI - Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning AU - Wenhao Zhang AU - Yibo Xie AU - Rui Wang AU - Jiahua Yang AU - Lei Jiang AU - Zibo Yang AU - Yawei Wang AU - Jiali Xu AU - jasperawang AU - Haoyang Long AU - Huan Xiong AU - alantzhao PY - 2026 UR - https://arxiv.org/abs/2608.01418 ID - 2608.01418 ER -