LLaVA: Large Language and Vision Assistant¶
Authors: Liu et al. Year: 2023 ArXiv/Link: https://arxiv.org/abs/2304.08485
Summary¶
Connects vision and language modalities using a simple projection layer, creating effective multimodal LLMs.
Key Concepts¶
- Multimodal fusion
- Vision-language integration
- Instruction-following
- Visual understanding
- LLM-based reasoning
Impact¶
Practical and efficient multimodal language models
Category¶
Vision-Language Models