@misc{indiciaec4a75d73a933, title = {Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases}, author = {Dongyoon Hahm and Dylan Hadfield-Menell and Kimin Lee}, year = {2026}, url = {https://arxiv.org/abs/2605.27355}, note = {Source identifier: 2605.27355} }