TY - RPRT TI - EquiBench: Benchmarking Large Language Models' Reasoning about Program Semantics via Equivalence Checking AU - Anjiang Wei AU - Jiannan Cao AU - Ran Li AU - Hongyu Chen AU - Yuhui Zhang AU - Ziheng Wang AU - Yuan Liu AU - Thiago S. F. X. Teixeira AU - Diyi Yang AU - Ke Wang AU - Alex Aiken PY - 2025 UR - https://arxiv.org/abs/2502.12466 ID - 2502.12466 ER -