@article{enablingefficientserverlessinference, title = {Enabling Efficient Serverless Inference Serving for LLM (Large Language Model) in the Cloud}, author = {Himel Ghosh}, year = {2024}, eprint = {2411.15664}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2411.15664v1}, }