TY - RPRT TI - LLMs instead of Human Judges? A Large Scale Empirical Study across 20 NLP Evaluation Tasks AU - Anna Bavaresco AU - Raffaella Bernardi AU - Leonardo Bertolazzi AU - Desmond Elliott AU - Raquel Fernández AU - Albert Gatt AU - Esam Ghaleb AU - Mario Giulianelli AU - Michael Hanna AU - Alexander Koller AU - André F. T. Martins AU - Philipp Mondorf AU - Vera Neplenbroek AU - Sandro Pezzelle AU - Barbara Plank AU - David Schlangen AU - Alessandro Suglia AU - Aditya K Surikuchi AU - Ece Takmaz AU - Alberto Testoni PY - 2025 UR - https://arxiv.org/abs/2406.18403 ID - 2406.18403 ER -