TY - RPRT TI - Gradient Cuff: Detecting Jailbreak Attacks on Large Language Models by Exploring Refusal Loss Landscapes AU - Xiaomeng Hu AU - Pin-Yu Chen AU - Tsung-Yi Ho PY - 2024 UR - https://arxiv.org/abs/2403.00867 ID - 2403.00867 ER -