CPVT
Conditional Position Encoding Vision Transformer
2000년 도입 · 논문 2편에서 사용
CPVT, or Conditional Position Encoding Vision Transformer, is a type of vision transformer which utilizes conditional positional encoding. Other than the new encodings, it follows the same architecture of ViT and DeiT.
출처: Conditional Positional Encodings for Vision Transformers
소개 논문: Conditional Positional Encodings for Vision Transformers
Vision Transformers · Computer Vision