TY - RPRT TI - Enhancing Multi-Step Reasoning Abilities of Language Models through Direct Q-Function Optimization AU - Kaixuan Ji AU - Guanlin Liu AU - Ning Dai AU - Qingping Yang AU - Renjie Zheng AU - Zheng Wu AU - Chen Dun AU - Quanquan Gu AU - Lin Yan PY - 2025 UR - https://arxiv.org/abs/2410.09302 ID - 2410.09302 ER -