TY - RPRT TI - Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only AU - Qingru Zhang AU - Liang Qiu AU - Ilgee Hong AU - Zhenghao Xu AU - Tianyi Liu AU - Shiyang Li AU - Rongzhi Zhang AU - Zheng Li AU - Lihong Li AU - Bing Yin AU - Chao Zhang AU - Jianshu Chen AU - Haoming Jiang AU - Tuo Zhao PY - 2025 UR - https://arxiv.org/abs/2510.21090 ID - 2510.21090 ER -