@misc{indiciae7a41efa37373, title = {Future Policy Approximation for Offline Reinforcement Learning in LLM Reasoning}, author = {Minjae Oh and Yunho Choi and Dongmin Choi and Yohan Jo}, year = {2026}, url = {https://arxiv.org/abs/2509.19893}, note = {Source identifier: 2509.19893} }