TY - RPRT TI - Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning AU - Yuanda Xu AU - Hejian Sang AU - Zhengze Zhou AU - Ran He AU - Zhipeng Wang PY - 2026 UR - https://arxiv.org/abs/2602.21420 ID - 2602.21420 ER -