TY - RPRT TI - Learning From Correctness Without Prompting Makes LLM Efficient Reasoner AU - Yuxuan Yao AU - Han Wu AU - Zhijiang Guo AU - Biyan Zhou AU - Jiahui Gao AU - Sichun Luo AU - Hanxu Hou AU - Xiaojin Fu AU - Linqi Song PY - 2024 UR - https://arxiv.org/abs/2403.19094 ID - 2403.19094 ER -