TY - RPRT TI - Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective AU - Shenghua He AU - Tian Xia AU - Xuan Zhou AU - Hui Wei PY - 2025 UR - https://arxiv.org/abs/2506.02553 ID - 2506.02553 ER -