TY - RPRT TI - Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning AU - Huchen Jiang AU - Yangyang Ma AU - Chaofan Ding AU - Kexin Luan AU - Xinhan Di PY - 2024 UR - https://arxiv.org/abs/2412.17397 ID - 2412.17397 ER -