TY - RPRT TI - MARS: Benchmarking the Metaphysical Reasoning Abilities of Language Models with a Multi-task Evaluation Dataset AU - Weiqi Wang AU - Yangqiu Song PY - 2025 UR - https://arxiv.org/abs/2406.02106 ID - 2406.02106 ER -