@misc{indiciaec13e0c319b38, title = {Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing}, author = {Yinzhi Zhao and Ming Wang and Shi Feng and Xiaocui Yang and Daling Wang and Yifei Zhang}, year = {2026}, url = {https://arxiv.org/abs/2601.10543}, note = {Source identifier: 2601.10543} }