@article{enablingdisaggregatedmultistagemllminfer, title = {Enabling Disaggregated Multi-Stage MLLM Inference via GPU-Internal Scheduling and Resource Sharing}, author = {Lingxiao Zhao and Haoran Zhou and Yuezhi Che and Dazhao Cheng}, year = {2025}, eprint = {2512.17574}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2512.17574}, }