@misc{indiciaeab48dcfc75dd, title = {Efficient Safety Alignment of Large Language Models via Preference Re-ranking and Representation-based Reward Modeling}, author = {Qiyuan Deng and Xuefeng Bai and Kehai Chen and Yaowei Wang and Liqiang Nie and Min Zhang}, year = {2025}, url = {https://arxiv.org/abs/2503.10093}, note = {Source identifier: 2503.10093} }