TY - RPRT TI - Honesty to Subterfuge: In-Context Reinforcement Learning Can Make Honest Models Reward Hack AU - Leo McKee-Reid AU - Christoph Sträter AU - Maria Angelica Martinez AU - Joe Needham AU - Mikita Balesni PY - 2024 UR - https://arxiv.org/abs/2410.06491 ID - 2410.06491 ER -