TY - RPRT TI - Chain of Preference Optimization: Improving Chain-of-Thought Reasoning in LLMs AU - Xuan Zhang AU - Chao Du AU - Tianyu Pang AU - Qian Liu AU - Wei Gao AU - Min Lin PY - 2024 UR - https://arxiv.org/abs/2406.09136 ID - 2406.09136 ER -