@article{smallerweakeryetbettertrainingllm, title = {Smaller, Weaker, Yet Better: Training LLM Reasoners via Compute-Optimal Sampling}, author = {Hritik Bansal and Arian Hosseini and Rishabh Agarwal and Vinh Q. Tran and Mehran Kazemi}, year = {2024}, eprint = {2408.16737}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2408.16737v2}, }