@misc{indiciaec43103e1f703, title = {Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness}, author = {Pardis Sadat Zahraei and Janvijay Singh and Gokhan Tur and Dilek Hakkani-Tur}, year = {2026}, url = {https://arxiv.org/abs/2610.00568}, note = {Source identifier: 2610.00568} }