TY - RPRT TI - Reasoning or Memorization? Unreliable Results of Reinforcement Learning Due to Data Contamination AU - Mingqi Wu AU - Zhihao Zhang AU - Qiaole Dong AU - Zhiheng Xi AU - Jun Zhao AU - Senjie Jin AU - Xiaoran Fan AU - Yuhao Zhou AU - Huijie Lv AU - Ming Zhang AU - Yanwei Fu AU - Qin Liu AU - Songyang Zhang AU - Qi Zhang PY - 2025 UR - https://arxiv.org/abs/2507.10532 ID - 2507.10532 ER -