TY - RPRT TI - Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models AU - Yingshui Tan AU - Yilei Jiang AU - Yanshi Li AU - Jiaheng Liu AU - Xingyuan Bu AU - Wenbo Su AU - Xiangyu Yue AU - Xiaoyong Zhu AU - Bo Zheng PY - 2025 UR - https://arxiv.org/abs/2502.11555 ID - 2502.11555 ER -