TY - RPRT TI - Exploring the Reliability of Large Language Models as Customized Evaluators for Diverse NLP Tasks AU - Qintong Li AU - Leyang Cui AU - Lingpeng Kong AU - Wei Bi PY - 2025 UR - https://arxiv.org/abs/2310.19740 ID - 2310.19740 ER -