@misc{indiciae9c19a3324f07, title = {Co-rewarding: Stable Self-supervised RL for Eliciting Reasoning in Large Language Models}, author = {Zizhuo Zhang and Jianing Zhu and Xinmu Ge and Zihua Zhao and Zhanke Zhou and Xuan Li and Xiao Feng and Jiangchao Yao and Bo Han}, year = {2026}, url = {https://arxiv.org/abs/2508.00410}, note = {Source identifier: 2508.00410} }