@misc{indiciae5f576a64a8cd, title = {Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling}, author = {Hritik Bansal and Arian Hosseini and Rishabh Agarwal and Vinh Q. Tran and Mehran Kazemi}, year = {2024}, url = {https://arxiv.org/abs/2408.16737}, note = {Source identifier: 2408.16737} }