TY - RPRT TI - Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling AU - Qiyuan Deng AU - Xuefeng Bai AU - Kehai Chen AU - Yaowei Wang AU - Liqiang Nie AU - Min Zhang PY - 2025 UR - https://arxiv.org/abs/2503.10093 ID - 2503.10093 ER -