Quantization for Efficient Inference Reading List
Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026
Key papers on quantizing neural networks for efficiency — from integer training to post-training LLM quantization with outliers and activation smoothing.
Quantization for Efficient Inference: 10 key papers
- A White Paper on Neural Network Quantization
Nagel et al. arXiv 2021.
- Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference
Jacob et al. arXiv 2017.
- LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale
Dettmers et al. arXiv 2022.
- GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
Frantar et al. arXiv 2022.
- AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
Lin et al. arXiv 2023.
- QLoRA: Efficient Finetuning of Quantized LLMs
Dettmers et al. arXiv 2023.
- SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models
Xiao et al. arXiv 2022.
- Binarized Neural Networks: Training Deep Neural Networks with Weights and Activations Constrained to +1 or -1
Courbariaux et al. arXiv 2016.
- XNOR-Net: ImageNet Classification Using Binary Convolutional Neural Networks
Rastegari et al. arXiv 2016.
- Up or Down? Adaptive Rounding for Post-Training Quantization
Nagel et al. arXiv 2020.
← Back to main page