@misc{indiciae40a046a1cec2, title = {Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models}, author = {Mingyu Zong and Sampad Mohanty and Bhaskar Krishnamachari}, year = {2026}, url = {https://arxiv.org/abs/2608.11583}, note = {Source identifier: 2608.11583} }