@article{provisionprogrammaticallyscalingvision, title = {ProVision: Programmatically Scaling Vision-centric Instruction Data for Multimodal Language Models}, author = {Jieyu Zhang and Le Xue and Linxin Song and Jun Wang and Weikai Huang and Manli Shu and An Yan and Zixian Ma and Juan Carlos Niebles and Silvio Savarese and Caiming Xiong and Zeyuan Chen and Ranjay Krishna and ran Xu}, year = {2024}, eprint = {2412.07012}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2412.07012v3}, }