TY - RPRT TI - On the effectiveness of reward functions in reinforcement learning for confidence calibration of large language models AU - Chee Heng Tan AU - Zhuoyi Lin AU - Mehul Motani AU - Wee Sun Lee PY - 2026 UR - https://arxiv.org/abs/2607.04332 ID - 2607.04332 ER -