TY - RPRT TI - Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models AU - Zizhuo Zhang AU - Jianing Zhu AU - Xinmu Ge AU - Zihua Zhao AU - Zhanke Zhou AU - Xuan Li AU - Xiao Feng AU - Jiangchao Yao AU - Bo Han PY - 2026 UR - https://arxiv.org/abs/2508.00410 ID - 2508.00410 ER -