TY - RPRT TI - Self-Training with Direct Preference Optimization Improves Chain-of-Thought Reasoning AU - Tianduo Wang AU - Shichen Li AU - Wei Lu PY - 2024 UR - https://arxiv.org/abs/2407.18248 ID - 2407.18248 ER -