@misc{indiciaeaafc8e6aea9f, title = {Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference}, author = {Wenjie Qiu and Yi-Chen Li and Xuqin Zhang and Tianyi Zhang and Yihang Zhang and Zongzhang Zhang and Yang Yu}, year = {2025}, url = {https://arxiv.org/abs/2503.04793}, note = {Source identifier: 2503.04793} }