TY - RPRT TI - Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models AU - Aswin RRV AU - Jacob Dineen AU - Divij Handa AU - Mihir Parmar AU - Ben Zhou AU - Swaroop Mishra AU - Chitta Baral PY - 2026 UR - https://arxiv.org/abs/2605.08472 ID - 2605.08472 ER -