@misc{indiciaeff625d9901d3, title = {Large Language Models are Qualified Benchmark Builders: Rebuilding Pre-Training Datasets for Advancing Code Intelligence Tasks}, author = {Kang Yang and Xinjun Mao and Shangwen Wang and Yanlin Wang and Tanghaoran Zhang and Bo Lin and Yihao Qin and Zhang Zhang and Yao Lu and Kamal Al-Sabahi}, year = {2025}, url = {https://arxiv.org/abs/2504.19444}, note = {Source identifier: 2504.19444} }