TY - RPRT TI - Can Large Language Models be Trusted for Evaluation? Scalable Meta-Evaluation of LLMs as Evaluators via Agent Debate AU - Steffi Chern AU - Ethan Chern AU - Graham Neubig AU - Pengfei Liu PY - 2024 UR - https://arxiv.org/abs/2401.16788 ID - 2401.16788 ER -