TY - RPRT TI - GRPO-LEAD: A Difficulty-Aware Reinforcement Learning Approach for Concise Mathematical Reasoning in Language Models AU - Jixiao Zhang AU - Chunsheng Zuo PY - 2025 UR - https://arxiv.org/abs/2504.09696 ID - 2504.09696 ER -