TY - RPRT TI - Do Large Language Models Know What They Don't Know? Kalshibench: A New Benchmark for Evaluating Epistemic Calibration via Prediction Markets AU - Lukas Nel PY - 2025 UR - https://arxiv.org/abs/2512.16030 ID - 2512.16030 ER -