TY - RPRT TI - Gradients Know What Outcomes Don't: Unlocking Reinforcement Learning for LLM Reasoning with Gradient-Aligned Rewards AU - Leqi Zheng AU - Jinbo Su AU - Fang Niu AU - Chaokun Wang AU - Weiping Wang AU - Jiajun Zhang AU - Shannan Yan AU - Jie Wu AU - Zhaolu Kang AU - Rong Fu AU - Hang Zhang PY - 2026 UR - https://arxiv.org/abs/2609.03342 ID - 2609.03342 ER -