TY - RPRT TI - Reinforcement Learning Can Amplify Emergent Misalignment from Harmless Rewards AU - Magnus Jørgenvåg AU - David Kaczér AU - Lasse Ruttert AU - Marvin Gülhan AU - Lucie Flek AU - Florian Mai PY - 2026 UR - https://arxiv.org/abs/2605.31328 ID - 2605.31328 ER -