@article{minillmmemoryefficientstructuredpruning, title = {MINI-LLM: Memory-Efficient Structured Pruning for Large Language Models}, author = {Hongrong Cheng and Miao Zhang and Javen Qinfeng Shi}, year = {2024}, eprint = {2407.11681}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.11681v1}, }