TY - RPRT TI - Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards AU - Zhengzhao Ma AU - Xueru Wen AU - Boxi Cao AU - Yaojie Lu AU - Hongyu Lin AU - Jinglin Yang AU - Min He AU - Xianpei Han AU - Le Sun PY - 2026 UR - https://arxiv.org/abs/2603.09117 ID - 2603.09117 ER -