TY - RPRT TI - Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models AU - Xiangyu Zhou AU - Saleh Zare Zade AU - Rafi Ibn Sultan AU - Alexander Kotov AU - Dongxiao Zhu PY - 2026 UR - https://arxiv.org/abs/2609.36254 ID - 2609.36254 ER -