@article{vilauaunifiedfoundationmodelintegrating, title = {VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation}, author = {Yecheng Wu and Zhuoyang Zhang and Junyu Chen and Haotian Tang and Dacheng Li and Yunhao Fang and Ligeng Zhu and Enze Xie and Hongxu Yin and Li Yi and Song Han and Yao Lu}, year = {2024}, eprint = {2409.04429}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2409.04429v2}, }