@article{catv2tontamingdiffusiontransformersfor, title = {CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation}, author = {Zheng Chong and Wenqing Zhang and Shiyue Zhang and Jun Zheng and Xiao Dong and Haoxiang Li and Yiling Wu and Dongmei Jiang and Xiaodan Liang}, year = {2025}, eprint = {2501.11325}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2501.11325v1}, }