TY - RPRT TI - Can LLM Reasoning Be Trusted? A Comparative Study: Using Human Benchmarking on Statistical Tasks AU - Crish Nagarkar AU - Leonid Bogachev AU - Serge Sharoff PY - 2026 UR - https://arxiv.org/abs/2601.14479 ID - 2601.14479 ER -