TY - RPRT TI - Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Markov Likelihood AU - Xingyu Lin AU - Yilin Wen AU - En Wang AU - Du Su AU - Wenbin Liu AU - Chenfu Bao AU - Zhonghou Lv PY - 2025 UR - https://arxiv.org/abs/2510.09369 ID - 2510.09369 ER -