@article{illmefficientintegeronlyinferencefor, title = {I-LLM: Efficient Integer-Only Inference for Fully-Quantized Low-Bit Large Language Models}, author = {Xing Hu and Yuan Cheng and Dawei Yang and Zhihang Yuan and Jiangyong Yu and Chen Xu and Sifan Zhou}, year = {2024}, eprint = {2405.17849}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2405.17849v2}, }