@misc{indiciaeb2e21b93d455, title = {SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM}, author = {Xiaojiang Zhang and Jinghui Wang and Zifei Cheng and Wenhao Zhuang and Zheng Lin and Minglei Zhang and Shaojie Wang and Yinghan Cui and Chao Wang and Junyi Peng and Shimiao Jiang and Shiqi Kuang and Shouyu Yin and Chaohang Wen and Haotian Zhang and Bin Chen and Bing Yu}, year = {2025}, url = {https://arxiv.org/abs/2504.14286}, note = {Source identifier: 2504.14286} }