TY - RPRT TI - When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models AU - Yingzhi Mao AU - Chunkang Zhang AU - Junxiang Wang AU - Xinyan Guan AU - Boxi Cao AU - Yaojie Lu AU - Hongyu Lin AU - Xianpei Han AU - Le Sun PY - 2026 UR - https://arxiv.org/abs/2510.21285 ID - 2510.21285 ER -