TY - RPRT TI - Detecting Data Contamination from Reinforcement Learning Post-training for Large Language Models AU - Yongding Tao AU - Tian Wang AU - Yihong Dong AU - Huanyu Liu AU - Kechi Zhang AU - Xiaolong Hu AU - Ge Li PY - 2026 UR - https://arxiv.org/abs/2510.09259 ID - 2510.09259 ER -