TY - RPRT TI - Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models AU - Mingyu Zong AU - Sampad Mohanty AU - Bhaskar Krishnamachari PY - 2026 UR - https://arxiv.org/abs/2608.11583 ID - 2608.11583 ER -