TY - RPRT TI - SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM AU - Xiaojiang Zhang AU - Jinghui Wang AU - Zifei Cheng AU - Wenhao Zhuang AU - Zheng Lin AU - Minglei Zhang AU - Shaojie Wang AU - Yinghan Cui AU - Chao Wang AU - Junyi Peng AU - Shimiao Jiang AU - Shiqi Kuang AU - Shouyu Yin AU - Chaohang Wen AU - Haotian Zhang AU - Bin Chen AU - Bing Yu PY - 2025 UR - https://arxiv.org/abs/2504.14286 ID - 2504.14286 ER -