TY - RPRT TI - Assessing and Advancing Benchmarks for Evaluating Large Language Models in Software Engineering Tasks AU - Xing Hu AU - Feifei Niu AU - Junkai Chen AU - Xin Zhou AU - Junwei Zhang AU - Junda He AU - Xin Xia AU - David Lo PY - 2025 UR - https://arxiv.org/abs/2505.08903 ID - 2505.08903 ER -