TY - RPRT TI - MMLU-SR: A Benchmark for Stress-Testing Reasoning Capability of Large Language Models AU - Wentian Wang AU - Sarthak Jain AU - Paul Kantor AU - Jacob Feldman AU - Lazaros Gallos AU - Hao Wang PY - 2024 UR - https://arxiv.org/abs/2406.15468 ID - 2406.15468 ER -