TY - RPRT TI - Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood AU - Xingyu Lin AU - Yilin Wen AU - Du Su AU - Jinchang Hou AU - En Wang AU - Wenbin Liu AU - Chenfu Bao AU - Zhonghou Lv PY - 2026 UR - https://arxiv.org/abs/2604.12736 ID - 2604.12736 ER -