TY - RPRT TI - Sentence-level Reward Model can Generalize Better for Aligning LLM from Human Preference AU - Wenjie Qiu AU - Yi-Chen Li AU - Xuqin Zhang AU - Tianyi Zhang AU - Yihang Zhang AU - Zongzhang Zhang AU - Yang Yu PY - 2025 UR - https://arxiv.org/abs/2503.04793 ID - 2503.04793 ER -