TY - RPRT TI - ConfidenceBench: Evaluating Confidence Calibration in Large Language Models AU - Matthew ffrench-Constant AU - Daniel Yang AU - Xinmeng Huang AU - Sanyam Kapoor PY - 2026 UR - https://arxiv.org/abs/2607.20526 ID - 2607.20526 ER -