TY - RPRT TI - Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing AU - Yinzhi Zhao AU - Ming Wang AU - Shi Feng AU - Xiaocui Yang AU - Daling Wang AU - Yifei Zhang PY - 2026 UR - https://arxiv.org/abs/2601.10543 ID - 2601.10543 ER -