TY - RPRT TI - Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study AU - Yinuo Liu AU - Emre Sezgin AU - Eric A. Youngstrom PY - 2026 UR - https://arxiv.org/abs/2601.19925 ID - 2601.19925 ER -