TY - RPRT TI - Lost in Benchmarks? Rethinking Large Language Model Benchmarking with Item Response Theory AU - Hongli Zhou AU - Hui Huang AU - Ziqing Zhao AU - Lvyuan Han AU - Huicheng Wang AU - Kehai Chen AU - Muyun Yang AU - Wei Bao AU - Jian Dong AU - Bing Xu AU - Conghui Zhu AU - Hailong Cao AU - Tiejun Zhao PY - 2026 UR - https://arxiv.org/abs/2505.15055 ID - 2505.15055 ER -