TY - RPRT TI - HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization AU - Chengyu Huang AU - Zhengxin Zhang AU - Claire Cardie PY - 2025 UR - https://arxiv.org/abs/2505.11225 ID - 2505.11225 ER -