TY - RPRT TI - Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning AU - Fei Ding AU - Yongkang Zhang AU - Runhao Liu AU - Yuhao Liao AU - Zijian Zeng AU - Sibo wang AU - Huiming Yang PY - 2026 UR - https://arxiv.org/abs/2605.05226 ID - 2605.05226 ER -