@misc{indiciaedb112c3f306d, title = {Robust LLM safeguarding via refusal feature adversarial training}, author = {Lei Yu and Virginie Do and Karen Hambardzumyan and Nicola Cancedda}, year = {2025}, url = {https://arxiv.org/abs/2409.20089}, note = {Source identifier: 2409.20089} }