Skip to content

QLoRA: Efficient Finetuning of Quantized LLMs

Authors: Dettmers, T., Pagnoni, A., Holtzman, A., & Schwettmann, S. Year: 2023 Venue: NeurIPS ArXiv: https://arxiv.org/abs/2305.14314

Summary

QLoRA combines 4-bit quantization with LoRA for extreme parameter efficiency. It enables fine-tuning of 65B parameter models on a single 48GB GPU, making LLM customization accessible without enterprise-grade hardware.

Key Concepts

  • 4-bit NormalFloat (NF4) quantization
  • Double quantization for weights
  • Paged optimizers for memory efficiency
  • Combines quantization + LoRA
  • 33B model on single GPU feasible
  • Minimal performance degradation from full precision
  • Unified memory approach

Impact

QLoRA democratized LLM fine-tuning by making 70B+ models accessible on consumer GPUs. It proved quantization doesn't compromise adapter fine-tuning quality, enabling widespread model customization.


Citation:

@inproceedings{dettmers2023qlora,
  title={QLoRA: Efficient Finetuning of Quantized LLMs},
  author={Dettmers, Tim and Pagnoni, Artidoro and Holtzman, Ari and Schwettmann, Samir},
  booktitle={Advances in Neural Information Processing Systems},
  year={2023}
}