TY - RPRT TI - s2n-bignum-bench: A practical benchmark for evaluating low-level code reasoning of LLMs AU - Balaji Rao AU - John Harrison AU - Soonho Kong AU - Juneyoung Lee AU - Carlo Lipizzi PY - 2026 UR - https://arxiv.org/abs/2603.14628 ID - 2603.14628 ER -