TY - RPRT TI - How Reliable are Confidence Estimators for Large Reasoning Models? A Systematic Benchmark on High-Stakes Domains AU - Reza Khanmohammadi AU - Erfan Miahi AU - Simerjot Kaur AU - Ivan Brugere AU - Charese H. Smiley AU - Kundan Thind AU - Mohammad M. Ghassemi PY - 2026 UR - https://arxiv.org/abs/2601.08134 ID - 2601.08134 ER -