TY - RPRT TI - Long-Horizon Language Model Reinforcement Learning via Progressive Point Matching AU - Preston Fu AU - Kevin Frans AU - Oleh Rybkin AU - Sergey Levine AU - Aviral Kumar PY - 2026 UR - https://arxiv.org/abs/2609.07303 ID - 2609.07303 ER -