@article{flashdllmioawarekvcachingandparalleldeco, title = {Flash-dLLM: IO-Aware KV Caching and Parallel Decoding for Fast, Memory-Efficient Diffusion LLMs}, author = {Quan Nguyen-Tri and Mukul Ranjan and Zhiqiang Shen}, year = {2026}, eprint = {2609.26796}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2609.26796}, }