TY - RPRT TI - StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason AU - Kaiyi Zhang AU - Ang Lv AU - Jinpeng Li AU - Yongbo Wang AU - Feng Wang AU - Haoyuan Hu AU - Rui Yan PY - 2025 UR - https://arxiv.org/abs/2507.02841 ID - 2507.02841 ER -