TY - RPRT TI - AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification AU - Xiaoyu Tan AU - Tianchu Yao AU - Chao Qu AU - Bin Li AU - Minghao Yang AU - Dakuan Lu AU - Haozhe Wang AU - Xihe Qiu AU - Wei Chu AU - Yinghui Xu AU - Yuan Qi PY - 2025 UR - https://arxiv.org/abs/2502.11520 ID - 2502.11520 ER -