@article{astudyonhiddenlayerdistillationforlargel, title = {A Study on Hidden Layer Distillation for Large Language Model Pre-Training}, author = {Maxime Guigon and Lucas Dixon and Michaƫl E. Sander}, year = {2026}, eprint = {2605.11513}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2605.11513}, }