TY - RPRT TI - Evaluation Metrics in the Era of GPT-4: Reliably Evaluating Large Language Models on Sequence to Sequence Tasks AU - Andrea Sottana AU - Bin Liang AU - Kai Zou AU - Zheng Yuan PY - 2023 UR - https://arxiv.org/abs/2310.13800 ID - 2310.13800 ER -