TY - RPRT TI - Evaluating the Performance of Large Language Models via Debates AU - Behrad Moniri AU - Hamed Hassani AU - Edgar Dobriban PY - 2025 UR - https://arxiv.org/abs/2406.11044 ID - 2406.11044 ER -