TY - RPRT TI - Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning AU - Changyuan Tian AU - Zhicong Lu AU - Shuang Qian AU - Nayu Liu AU - Peiguang Li AU - Li Jin AU - Leiyi Hu AU - Zhizhao Zeng AU - Sirui Wang AU - Ke Zeng AU - Zhi Guo PY - 2025 UR - https://arxiv.org/abs/2511.10303 ID - 2511.10303 ER -