@misc{indiciae65a010a3f6db, title = {ADORA: Training Reasoning Models with Dynamic Advantage Estimation on Reinforcement Learning}, author = {Qingnan Ren and Shiting Huang and Zhen Fang and Zehui Chen and Lin Chen and Lijun Li and Feng Zhao}, year = {2026}, url = {https://arxiv.org/abs/2602.10019}, note = {Source identifier: 2602.10019} }