TY - RPRT TI - Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling AU - Hritik Bansal AU - Arian Hosseini AU - Rishabh Agarwal AU - Vinh Q. Tran AU - Mehran Kazemi PY - 2024 UR - https://arxiv.org/abs/2408.16737 ID - 2408.16737 ER -