TY - RPRT TI - Leash: Adaptive Length Penalty and Reward Shaping for Efficient Large Reasoning Model AU - Yanhao Li AU - Lu Ma AU - Jiaran Zhang AU - Lexiang Tang AU - Wentao Zhang AU - Guibo Luo PY - 2025 UR - https://arxiv.org/abs/2512.21540 ID - 2512.21540 ER -