@article{mmadavlalargediffusionvisionlanguageacti, title = {MMaDA-VLA: Large Diffusion Vision-Language-Action Model with Unified Multi-Modal Instruction and Generation}, author = {Yang Liu and Pengxiang Ding and Tengyue Jiang and Xudong Wang and Wenxuan Song and Minghui Lin and Han Zhao and Hongyin Zhang and Zifeng Zhuang and Wei Zhao and Siteng Huang and Jinkui Shi and Donglin Wang}, year = {2026}, eprint = {2603.25406}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2603.25406}, }