TY - RPRT TI - Compromising Honesty and Harmlessness in Language Models via Deception Attacks AU - Laurène Vaugrante AU - Francesca Carlon AU - Maluna Menke AU - Thilo Hagendorff PY - 2025 UR - https://arxiv.org/abs/2502.08301 ID - 2502.08301 ER -