@article{tplatensorparallellatentattentionforeffi, title = {TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference}, author = {Xiaojuan Tang and Fanxu Meng and Pingzhi Tang and Yuxuan Wang and Di Yin and Xing Sun and Muhan Zhang}, year = {2025}, eprint = {2508.15881}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2508.15881}, }