TY - RPRT TI - Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning AU - Mahavir Dabas AU - Si Chen AU - Charles Fleming AU - Ming Jin AU - Ruoxi Jia PY - 2025 UR - https://arxiv.org/abs/2507.04250 ID - 2507.04250 ER -