TY - RPRT TI - Teaching LLMs to Abstain via Fine-Grained Semantic Confidence Reward AU - Hao An AU - Yang Xu PY - 2025 UR - https://arxiv.org/abs/2510.24020 ID - 2510.24020 ER -