Skip to content

LLaVA: Large Language and Vision Assistant

Authors: Liu et al. Year: 2023 ArXiv/Link: https://arxiv.org/abs/2304.08485

Summary

Connects vision and language modalities using a simple projection layer, creating effective multimodal LLMs.

Key Concepts

  • Multimodal fusion
  • Vision-language integration
  • Instruction-following
  • Visual understanding
  • LLM-based reasoning

Impact

Practical and efficient multimodal language models

Category

Vision-Language Models