TY - RPRT TI - DeepSeek-Prover-V1.5: Harnessing Proof Assistant Feedback for Reinforcement Learning and Monte-Carlo Tree Search AU - Huajian Xin AU - Z. Z. Ren AU - Junxiao Song AU - Zhihong Shao AU - Wanjia Zhao AU - Haocheng Wang AU - Bo Liu AU - Liyue Zhang AU - Xuan Lu AU - Qiushi Du AU - Wenjun Gao AU - Qihao Zhu AU - Dejian Yang AU - Zhibin Gou AU - Z. F. Wu AU - Fuli Luo AU - Chong Ruan PY - 2024 UR - https://arxiv.org/abs/2408.08152 ID - 2408.08152 ER -