TY - RPRT TI - Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning AU - Yuxi Xie AU - Anirudh Goyal AU - Wenyue Zheng AU - Min-Yen Kan AU - Timothy P. Lillicrap AU - Kenji Kawaguchi AU - Michael Shieh PY - 2024 UR - https://arxiv.org/abs/2405.00451 ID - 2405.00451 ER -