Model Compression for LLMs Survey
First page

Paper summary
A survey of recent model-compression techniques applied specifically to LLMs.
Ask this paper
01
Core technique families: Covers quantization, pruning, knowledge distillation, and architectural compression across training-time and post-training approaches.
02
LLM-specific concerns: Addresses unique LLM concerns including long-sequence compression, KV-cache optimization, and retaining reasoning capability under compression.
03
Evaluation metrics: Reviews benchmark strategies and evaluation metrics for measuring compressed-LLM effectiveness - not just perplexity but downstream capability preservation.
04
Practitioner reference: Functions as a compact reference for teams deciding which compression technique matches their deployment constraints.