@article{sparkvoverheadawarekvcacheloadingforeffi, title = {SparKV: Overhead-Aware KV Cache Loading for Efficient On-Device LLM Inference}, author = {Hongyao Liu and Liuqun Zhai and Junyi Wang and Zhengru Fang}, year = {2026}, eprint = {2604.21231}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2604.21231}, }