TY - RPRT TI - Grad2Reward: From Sparse Judgment to Dense Rewards for Improving Open-Ended LLM Reasoning AU - Zheng Zhang AU - Ao Lu AU - Yuanhao Zeng AU - Ziwei Shan AU - Jinjin Guo AU - Lufei Li AU - Yexin Li AU - Kan Ren PY - 2026 UR - https://arxiv.org/abs/2602.01791 ID - 2602.01791 ER -