paper-with-me

CPVT

Conditional Position Encoding Vision Transformer

2000년 도입 · 논문 2편에서 사용

CPVT, or Conditional Position Encoding Vision Transformer, is a type of vision transformer which utilizes conditional positional encoding. Other than the new encodings, it follows the same architecture of ViT and DeiT.

출처: Conditional Positional Encodings for Vision Transformers

소개 논문: Conditional Positional Encodings for Vision Transformers

Vision Transformers · Computer Vision