@article{towardbuildinggeneralfoundationmodelsfor, title = {Toward Building General Foundation Models for Language, Vision, and Vision-Language Understanding Tasks}, author = {Xinsong Zhang and Yan Zeng and Jipeng Zhang and Hang Li}, year = {2023}, eprint = {2301.05065}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2301.05065v2}, }