@article{exploringpretrainedtexttovideodiffusion, title = {Exploring Pre-trained Text-to-Video Diffusion Models for Referring Video Object Segmentation}, author = {Zixin Zhu and Xuelu Feng and Dongdong Chen and Junsong Yuan and Chunming Qiao and Gang Hua}, year = {2024}, eprint = {2403.12042}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2403.12042v2}, }