TY - RPRT TI - NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark AU - Oscar Sainz AU - Jon Ander Campos AU - Iker GarcĂ­a-Ferrero AU - Julen Etxaniz AU - Oier Lopez de Lacalle AU - Eneko Agirre PY - 2023 UR - https://arxiv.org/abs/2310.18018 ID - 2310.18018 ER -