TY - RPRT TI - Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models AU - Zheng Lin AU - Zhenxing Niu AU - Haoxuan Ji AU - Yuzhe Huang AU - Haichang Gao PY - 2026 UR - https://arxiv.org/abs/2605.19485 ID - 2605.19485 ER -