TY - RPRT TI - ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning AU - Qingnan Ren AU - Shiting Huang AU - Zhen Fang AU - Zehui Chen AU - Lin Chen AU - Lijun Li AU - Feng Zhao PY - 2026 UR - https://arxiv.org/abs/2602.10019 ID - 2602.10019 ER -