Efficient Transformers Reading List
Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026
Papers on making transformers faster and cheaper — from linear attention and sparse patterns to kernel and state-space alternatives.
Efficient Transformers: 10 key papers
- Efficient Transformers: A Survey
Tay et al. arXiv 2020.
- Longformer: The Long-Document Transformer
Beltagy et al. arXiv 2020.
- Big Bird: Transformers for Longer Sequences
Zaheer et al. arXiv 2020.
- Reformer: The Efficient Transformer
Kitaev et al. arXiv 2020.
- Linformer: Self-Attention with Linear Complexity
Wang et al. arXiv 2020.
- Rethinking Attention with Performers
Choromanski et al. arXiv 2020.
- Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention
Katharopoulos et al. arXiv 2020.
- FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness
Dao et al. arXiv 2022.
- Long Range Arena: A Benchmark for Efficient Transformers
Tay et al. arXiv 2020.
- Synthesizer: Rethinking Self-Attention in Transformer Models
Tay et al. arXiv 2020.
← Back to main page