@article{babyllama2ensembledistilledmodels, title = {BabyLlama-2: Ensemble-Distilled Models Consistently Outperform Teachers With Limited Data}, author = {Jean-Loup Tastet and Inar Timiryasov}, year = {2024}, eprint = {2409.17312}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2409.17312v1}, }