TY - RPRT TI - Learn to Reason Efficiently with Adaptive Length-based Reward Shaping AU - Wei Liu AU - Ruochen Zhou AU - Yiyun Deng AU - Yuzhen Huang AU - Junteng Liu AU - Yuntian Deng AU - Yizhe Zhang AU - Junxian He PY - 2025 UR - https://arxiv.org/abs/2505.15612 ID - 2505.15612 ER -