@misc{indiciae1d658dc22fc5, title = {When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards}, author = {Norah Alzahrani and Hisham Abdullah Alyahya and Yazeed Alnumay and Sultan Alrashed and Shaykhah Alsubaie and Yusef Almushaykeh and Faisal Mirza and Nouf Alotaibi and Nora Altwairesh and Areeb Alowisheq and M Saiful Bari and Haidar Khan}, year = {2024}, url = {https://arxiv.org/abs/2402.01781}, note = {Source identifier: 2402.01781} }