@misc{indiciae90991364eeb4, title = {Do we really have to filter out random noise in pre-training data for language models?}, author = {Jinghan Ru and Yuxin Xie and Xianwei Zhuang and Yuguo Yin and Zhihui Guo and Zhiming Liu and Qianli Ren and Yuexian Zou}, year = {2025}, url = {https://arxiv.org/abs/2502.06604}, note = {Source identifier: 2502.06604} }