TY - RPRT TI - Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs AU - Xin Lai AU - Zhuotao Tian AU - Yukang Chen AU - Senqiao Yang AU - Xiangru Peng AU - Jiaya Jia PY - 2024 UR - https://arxiv.org/abs/2406.18629 ID - 2406.18629 ER -