TY - RPRT TI - HeaPA: Difficulty-Aware Heap Sampling and On-Policy Query Augmentation for LLM Reinforcement Learning AU - Weiqi Wang AU - Xin Liu AU - Binxuan Huang AU - Hejie Cui AU - Rongzhi Zhang AU - Changlong Yu AU - Shuowei Jin AU - Jingfeng Yang AU - Qingyu Yin AU - Zhengyang Wang AU - Zheng Li AU - Yifan Gao AU - Priyanka Nigam AU - Bing Yin AU - Lihong Li AU - Yangqiu Song PY - 2026 UR - https://arxiv.org/abs/2601.22448 ID - 2601.22448 ER -