@article{vimigroundingvideogenerationthroughmulti, title = {VIMI: Grounding Video Generation through Multi-modal Instruction}, author = {Yuwei Fang and Willi Menapace and Aliaksandr Siarohin and Tsai-Shien Chen and Kuan-Chien Wang and Ivan Skorokhodov and Graham Neubig and Sergey Tulyakov}, year = {2024}, eprint = {2407.06304}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2407.06304v1}, }