TY - RPRT TI - Pitfalls of Evaluating Language Models with Open Benchmarks AU - Md. Najib Hasan AU - Md Mahadi Hassan Sibat AU - Mohammad Fakhruddin Babar AU - Souvika Sarkar AU - Monowar Hasan AU - Santu Karmaker PY - 2026 UR - https://arxiv.org/abs/2507.00460 ID - 2507.00460 ER -