TY - RPRT TI - Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation AU - Songjun Tu AU - Jiahao Lin AU - Xiangyu Tian AU - Qichao Zhang AU - Linjing Li AU - Yuqian Fu AU - Nan Xu AU - Wei He AU - Xiangyuan Lan AU - Dongmei Jiang AU - Dongbin Zhao PY - 2025 UR - https://arxiv.org/abs/2503.12854 ID - 2503.12854 ER -