Efficient Memory Management for Large Language Model Serving¶
Authors: Kwon et al. Year: 2023 ArXiv/Link: https://arxiv.org/abs/2309.06180
Summary¶
Memory optimization techniques for LLM serving including cache management and efficient batching.
Key Concepts¶
- Memory optimization
- Cache management
- Batching strategies
- KV cache
- Resource efficiency
Impact¶
Improved resource efficiency in LLM serving systems
Category¶
Serving & Optimization