Introduction
Quantization in modern LLMs
()
1. Mathematical Foundations
Introduction to quantization and number precision formats
()
Quantization error analysis
()
2. Post-Training Quantization
Uniform vs. non-uniform quantization schemes
()
Quantizing your first Transformer model
()
3. State-of-the-Art Quantization Algorithms
GPTQ: Principles and practical application
()
AWQ: Principles and practical application
()
SmoothQuant and emerging techniques
()
4. Quantization-Aware Training and Hardware Optimization
QAT fundamentals for Transformers
()
Hardware-specific optimization strategies
()
Conclusion
Future directions in LLM quantization
()