TY - RPRT TI - APR: Penalizing Structural Redundancy in Large Reasoning Models via Anchor-based Process Rewards AU - Kaiyan Chang AU - Chenwei Zhu AU - Yingfeng Luo AU - Yifu Huo AU - Chenglong Wang AU - Xiaoqian Liu AU - Qiaozhi He AU - Tong Xiao AU - Zhengtao Yu AU - Jingbo Zhu PY - 2026 UR - https://arxiv.org/abs/2602.00760 ID - 2602.00760 ER -