@article{compressinglargelanguagemodelsby, title = {Streamlining Redundant Layers to Compress Large Language Models}, author = {Xiaodong Chen and Yuxuan Hu and Jing Zhang and Yanling Wang and Cuiping Li and Hong Chen}, year = {2024}, eprint = {2403.19135}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2403.19135v5}, }