@misc{indiciaefa22deb5e11e, title = {Teaching LLM to be Persuasive: Reward-Enhanced Policy Optimization for Alignment from Heterogeneous Rewards}, author = {Xia Zeng and Yihan Chen and Luhui Liu and Chao Luo and Ye Chen and Zhuoran Zhuang}, year = {2026}, url = {https://arxiv.org/abs/2510.04214}, note = {Source identifier: 2510.04214} }