TY - RPRT TI - Cooper: Co-Optimizing Policy and Reward Models in Reinforcement Learning for Large Language Models AU - Haitao Hong AU - Yuchen Yan AU - Xingyu Wu AU - Guiyang Hou AU - Wenqi Zhang AU - Weiming Lu AU - Yongliang Shen AU - Jun Xiao PY - 2025 UR - https://arxiv.org/abs/2508.05613 ID - 2508.05613 ER -