Efficient ViTs
3개 벤치마크 · 논문 32편 · 이 태스크의 논문 보기 →
Benchmarks
ImageNet-1K (with DeiT-S)
ImageNet-1K (with DeiT-T)
ImageNet-1K (With LV-ViT-S)
Most implemented
Training data-efficient image transformers & distillation through attention
All Tokens Matter: Token Labeling for Training Better Vision Transformers
Token Merging: Your ViT But Faster
Fast Vision Transformers with HiLo Attention
Castling-ViT: Compressing Self-Attention via Switching Towards Linear-Angular Attention at Vision Transformer Inference
Pruning Self-attentions into Convolutional Layers in Single Path
Papers
ImagePiece: Content-aware Re-tokenization for Efficient Image Recognition
Vision Transformers (ViTs) have achieved remarkable success in various computer vision tasks. However, ViTs have a huge computational cost due to their inherent reliance on multi-head self-attention (MHSA), prompting eff…
Efficient ViTsToken ReductionM$^2$-ViT: Accelerating Hybrid Vision Transformers with Two-Level Mixed Quantization
Although Vision Transformers (ViTs) have achieved significant success, their intensive computations and substantial memory overheads challenge their deployment on edge devices. To address this, efficient ViTs have emerge…
Efficient ViTsQuantizationTrio-ViT: Post-Training Quantization and Acceleration for Softmax-Free Efficient Vision Transformer
Motivated by the huge success of Transformers in the field of natural language processing (NLP), Vision Transformers (ViTs) have been rapidly developed and achieved remarkable performance in various computer vision tasks…
Efficient ViTsModel CompressionQuantizationAn FPGA-Based Reconfigurable Accelerator for Convolution-Transformer Hybrid EfficientViT
Vision Transformers (ViTs) have achieved significant success in computer vision. However, their intensive computations and massive memory footprint challenge ViTs' deployment on embedded devices, calling for efficient Vi…
Efficient ViTsMulti-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers
Vision Transformer (ViT) has emerged as a prominent backbone for computer vision. For more efficient ViTs, recent works lessen the quadratic cost of the self-attention layer by pruning or fusing the redundant tokens. How…
Computational EfficiencyEfficient ViTsimage-classificationImage ClassificationGTP-ViT: Efficient Vision Transformers via Graph-based Token Propagation
Vision Transformers (ViTs) have revolutionized the field of computer vision, yet their deployments on resource-constrained devices remain challenging due to high computational demands. To expedite pre-trained ViTs, token…
Efficient ViTsImage Classification