@misc{indiciae3682d65801d1, title = {Iterative Length-Regularized Direct Preference Optimization: A Case Study on Improving 7B Language Models to GPT-4 Level}, author = {Jie Liu and Zhanhui Zhou and Jiaheng Liu and Xingyuan Bu and Chao Yang and Han-Sen Zhong and Wanli Ouyang}, year = {2024}, url = {https://arxiv.org/abs/2406.11817}, note = {Source identifier: 2406.11817} }