@article{mixtureofscalesmemoryefficienttoken, title = {Mixture of Scales: Memory-Efficient Token-Adaptive Binarization for Large Language Models}, author = {Dongwon Jo and Taesu Kim and Yulhwa Kim and Jae-Joon Kim}, year = {2024}, eprint = {2406.12311}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2406.12311v2}, }