TY - RPRT TI - Do we really have to filter out random noise in pre-training data for language models? AU - Jinghan Ru AU - Yuxin Xie AU - Xianwei Zhuang AU - Yuguo Yin AU - Zhihui Guo AU - Zhiming Liu AU - Qianli Ren AU - Yuexian Zou PY - 2025 UR - https://arxiv.org/abs/2502.06604 ID - 2502.06604 ER -