TY - RPRT TI - EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning AU - Weiyuan Li AU - Aili Chen AU - Xintao Wang AU - Yikai Zhang AU - Qingqing Dong AU - Jinghan Xu AU - Hongru Hou AU - Wenxuan Zhao AU - Chengkun Lang AU - Jun Gao AU - Yuanli Guo AU - Hongcheng Guo AU - Yanghua Xiao AU - Deqing Yang PY - 2026 UR - https://arxiv.org/abs/2609.12459 ID - 2609.12459 ER -