TY - RPRT TI - JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation AU - Shenyi Zhang AU - Yuchen Zhai AU - Keyan Guo AU - Hongxin Hu AU - Shengnan Guo AU - Zheng Fang AU - Lingchen Zhao AU - Chao Shen AU - Cong Wang AU - Qian Wang PY - 2025 UR - https://arxiv.org/abs/2502.07557 ID - 2502.07557 ER -