@article{h1bkvhybridonebitcachesformemoryefficien, title = {H1B-KV: Hybrid One-Bit Caches for Memory-Efficient Large Language Model Inference}, author = {Harshil Vejendla}, year = {2025}, eprint = {2510.05529}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2510.05529}, }