TY - RPRT TI - Robust LLM safeguarding via refusal feature adversarial training AU - Lei Yu AU - Virginie Do AU - Karen Hambardzumyan AU - Nicola Cancedda PY - 2025 UR - https://arxiv.org/abs/2409.20089 ID - 2409.20089 ER -