An Image is Worth 16x16 Words: Transformers for Image Recognition¶
Authors: Dosovitskiy et al. Year: 2020 ArXiv/Link: https://arxiv.org/abs/2010.11929
Summary¶
Vision Transformer (ViT) showed that pure transformer architectures can match or exceed convolutional networks for image classification.
Key Concepts¶
- Vision transformers
- Image patches
- Positional embeddings
- Transfer learning
- Image classification
Impact¶
Extended transformers to vision tasks, enabling multimodal architectures
Category¶
Optimization & Efficiency