TY - RPRT TI - Rewarding Doubt: A Reinforcement Learning Approach to Calibrated Confidence Expression of Large Language Models AU - David Bani-Harouni AU - Chantal Pellegrini AU - Paul Stangel AU - Ege Özsoy AU - Kamilia Zaripova AU - Nassir Navab AU - Matthias Keicher PY - 2026 UR - https://arxiv.org/abs/2503.02623 ID - 2503.02623 ER -