@article{learningclipguidedvisualtextfusion, title = {Learning CLIP Guided Visual-Text Fusion Transformer for Video-based Pedestrian Attribute Recognition}, author = {Jun Zhu and Jiandong Jin and Zihan Yang and Xiaohao Wu and Xiao Wang}, year = {2023}, eprint = {2304.10091}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2304.10091v1}, }