Skip to content

An Image is Worth 16x16 Words: Transformers for Image Recognition

Authors: Dosovitskiy et al. Year: 2020 ArXiv/Link: https://arxiv.org/abs/2010.11929

Summary

Vision Transformer (ViT) showed that pure transformer architectures can match or exceed convolutional networks for image classification.

Key Concepts

  • Vision transformers
  • Image patches
  • Positional embeddings
  • Transfer learning
  • Image classification

Impact

Extended transformers to vision tasks, enabling multimodal architectures

Category

Optimization & Efficiency