TY - RPRT TI - PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping AU - Qiming Li AU - Tianlun Li AU - Xiaolong Cheng AU - Hangyu Li AU - Ruiyan Gong AU - Kangning Niu AU - Kaitao Jiang AU - Mu Xu PY - 2026 UR - https://arxiv.org/abs/2606.08708 ID - 2606.08708 ER -