TY - RPRT TI - Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types AU - Hadas Orgad AU - Boyi Wei AU - Kaden Zheng AU - Martin Wattenberg AU - Peter Henderson AU - Seraphina Goldfarb-Tarrant AU - Yonatan Belinkov PY - 2026 UR - https://arxiv.org/abs/2604.09544 ID - 2604.09544 ER -