@inproceedings{vitcomervisiontransformerwith1, title = {ViT-CoMer: Vision Transformer with Convolutional Multi-scale Feature Interaction for Dense Predictions}, author = {Chunlong Xia and Xinliang Wang and Feng Lv and Xin Hao and Yifeng Shi}, year = {2024}, booktitle = {CVPR 2024 1}, eprint = {2403.07392}, archivePrefix = {arXiv}, url = {https://arxiv.org/abs/2403.07392v3}, }