TY - RPRT TI - L0-Reasoning Bench: Evaluating Procedural Correctness in Language Models via Simple Program Execution AU - Simeng Sun AU - Cheng-Ping Hsieh AU - Faisal Ladhak AU - Erik Arakelyan AU - Santiago Akle Serano AU - Boris Ginsburg PY - 2025 UR - https://arxiv.org/abs/2503.22832 ID - 2503.22832 ER -