TY - RPRT TI - Correlating and Predicting Human Evaluations of Language Models from Natural Language Processing Benchmarks AU - Rylan Schaeffer AU - Punit Singh Koura AU - Binh Tang AU - Ranjan Subramanian AU - Aaditya K Singh AU - Todor Mihaylov AU - Prajjwal Bhargava AU - Lovish Madaan AU - Niladri S. Chatterji AU - Vedanuj Goswami AU - Sergey Edunov AU - Dieuwke Hupkes AU - Sanmi Koyejo AU - Sharan Narang PY - 2025 UR - https://arxiv.org/abs/2502.18339 ID - 2502.18339 ER -