@misc{indiciaefc2a09a9d735, title = {NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark}, author = {Oscar Sainz and Jon Ander Campos and Iker GarcĂ­a-Ferrero and Julen Etxaniz and Oier Lopez de Lacalle and Eneko Agirre}, year = {2023}, url = {https://arxiv.org/abs/2310.18018}, note = {Source identifier: 2310.18018} }