TY - RPRT TI - Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation AU - Pei-Chi Pan AU - Yingbin Liang AU - Sen Lin PY - 2026 UR - https://arxiv.org/abs/2602.09305 ID - 2602.09305 ER -