TY - RPRT TI - SAFER: Probing Safety in Reward Models with Sparse Autoencoder AU - Wei Shi AU - Ziyuan Xie AU - Sihang Li AU - Xiang Wang PY - 2026 UR - https://arxiv.org/abs/2507.00665 ID - 2507.00665 ER -