TY - RPRT TI - How Reinforcement Learning After Next-Token Prediction Facilitates Learning AU - Nikolaos Tsilivis AU - Eran Malach AU - Karen Ullrich AU - Julia Kempe PY - 2025 UR - https://arxiv.org/abs/2510.11495 ID - 2510.11495 ER -