TY - RPRT TI - Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning AU - Minjae Oh AU - Yunho Choi AU - Dongmin Choi AU - Yohan Jo PY - 2026 UR - https://arxiv.org/abs/2509.19893 ID - 2509.19893 ER -