Skip to content

Efficient Memory Management for Large Language Model Serving

Authors: Kwon et al. Year: 2023 ArXiv/Link: https://arxiv.org/abs/2309.06180

Summary

Memory optimization techniques for LLM serving including cache management and efficient batching.

Key Concepts

  • Memory optimization
  • Cache management
  • Batching strategies
  • KV cache
  • Resource efficiency

Impact

Improved resource efficiency in LLM serving systems

Category

Serving & Optimization