@misc{indiciaebaaaff1a0825, title = {Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models}, author = {Haitao Hong and Yuchen Yan and Xingyu Wu and Guiyang Hou and Wenqi Zhang and Weiming Lu and Yongliang Shen and Jun Xiao}, year = {2025}, url = {https://arxiv.org/abs/2508.05613}, note = {Source identifier: 2508.05613} }