TY - RPRT TI - Beyond the Trade-off: Self-Supervised Reinforcement Learning for Reasoning Models' Instruction Following AU - Qingyu Ren AU - Qianyu He AU - Bowei Zhang AU - Jie Zeng AU - Jiaqing Liang AU - Yanghua Xiao AU - Weikang Zhou AU - Zeye Sun AU - Fei Yu PY - 2025 UR - https://arxiv.org/abs/2508.02150 ID - 2508.02150 ER -