TY - RPRT TI - Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases AU - Dongyoon Hahm AU - Dylan Hadfield-Menell AU - Kimin Lee PY - 2026 UR - https://arxiv.org/abs/2605.27355 ID - 2605.27355 ER -