TY - RPRT TI - Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning AU - Siyuan Gan AU - Jiaheng Liu AU - Boyan Wang AU - Tianpei Yang AU - Runqing Miao AU - Yuyao Zhang AU - Fanyu Meng AU - Junlan Feng AU - Linjian Meng AU - Jing Huo AU - Yang Gao PY - 2026 UR - https://arxiv.org/abs/2601.04805 ID - 2601.04805 ER -