TY - RPRT TI - Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models AU - Carson Denison AU - Monte MacDiarmid AU - Fazl Barez AU - David Duvenaud AU - Shauna Kravec AU - Samuel Marks AU - Nicholas Schiefer AU - Ryan Soklaski AU - Alex Tamkin AU - Jared Kaplan AU - Buck Shlegeris AU - Samuel R. Bowman AU - Ethan Perez AU - Evan Hubinger PY - 2024 UR - https://arxiv.org/abs/2406.10162 ID - 2406.10162 ER -