Policy Gradient Methods Reading List
Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026
The core ideas behind gradient-based policy optimization in RL.
Policy Gradient Methods: 10 key papers
- Trust Region Policy Optimization
Schulman et al. arXiv 2015.
- Proximal Policy Optimization Algorithms
Schulman et al. arXiv 2017.
- High-Dimensional Continuous Control Using Generalized Advantage Estimation
Schulman et al. arXiv 2015.
- Asynchronous Methods for Deep Reinforcement Learning
Mnih et al. arXiv 2016.
- Continuous control with deep reinforcement learning
Lillicrap et al. arXiv 2015.
- Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor
Haarnoja et al. arXiv 2018.
- Addressing Function Approximation Error in Actor-Critic Methods
Fujimoto et al. arXiv 2018.
- Sample Efficient Actor-Critic with Experience Replay
Wang et al. arXiv 2016.
- Global Convergence of Policy Gradient Methods for the Linear Quadratic Regulator
Fazel et al. arXiv 2018.
- On the Theory of Policy Gradient Methods: Optimality, Approximation, and Distribution Shift
Agarwal et al. arXiv 2019.
← Back to main page