TY - RPRT TI - Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards AU - Xia Zeng AU - Yihan Chen AU - Luhui Liu AU - Chao Luo AU - Ye Chen AU - Zhuoran Zhuang PY - 2026 UR - https://arxiv.org/abs/2510.04214 ID - 2510.04214 ER -