TY - RPRT TI - Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning AU - Junkang Wu AU - Kexin Huang AU - Jiancan Wu AU - An Zhang AU - Xiang Wang AU - Xiangnan He PY - 2026 UR - https://arxiv.org/abs/2509.22611 ID - 2509.22611 ER -