@misc{indiciaedc69ee8e7147, title = {Offline Reinforcement Learning for LLM Multi-Step Reasoning}, author = {Huaijie Wang and Shibo Hao and Hanze Dong and Shenao Zhang and Yilin Bao and Ziran Yang and Yi Wu}, year = {2024}, url = {https://arxiv.org/abs/2412.16145}, note = {Source identifier: 2412.16145} }