TY - RPRT TI - Beyond Benchmarking: A New Paradigm for Evaluation and Assessment of Large Language Models AU - Jin Liu AU - Qingquan Li AU - Wenlong Du PY - 2024 UR - https://arxiv.org/abs/2407.07531 ID - 2407.07531 ER -