@article{enhancinginferenceefficiencyoflarge, title = {Enhancing Inference Efficiency of Large Language Models: Investigating Optimization Strategies and Architectural Innovations}, author = {Georgy Tyukin}, year = {2024}, eprint = {2404.05741}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2404.05741v1}, }