TY - RPRT TI - MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation AU - Zhongshen Zeng AU - Pengguang Chen AU - Shu Liu AU - Haiyun Jiang AU - Jiaya Jia PY - 2024 UR - https://arxiv.org/abs/2312.17080 ID - 2312.17080 ER -