Off-Policy Evaluation & Offline Evaluation Reading List
Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026
Before deploying a policy you need to know how good it is from logged data alone. This list covers importance sampling, doubly robust, and minimax approaches to off-policy evaluation without new environment interaction.
Off-Policy Evaluation & Offline Evaluation: 10 key papers
- Doubly Robust Off-policy Value Evaluation for Reinforcement Learning
Jiang and Li. arXiv 2015.
- Data-Efficient Off-Policy Policy Evaluation for Reinforcement Learning
Thomas and Brunskill. arXiv 2016.
- Breaking the Curse of Horizon: Infinite-Horizon Off-Policy Estimation
Liu et al. arXiv 2018.
- Double Reinforcement Learning for Efficient Off-Policy Evaluation in Markov Decision Processes
Kallus and Uehara. arXiv 2019.
- Empirical Study of Off-Policy Policy Evaluation for Reinforcement Learning
Voloshin et al. arXiv 2019.
- Minimax Weight and Q-Function Learning for Off-Policy Evaluation
Uehara et al. arXiv 2019.
- Benchmarks for Deep Off-Policy Evaluation
Fu et al. arXiv 2021.
- Batch Policy Learning under Constraints
Le et al. arXiv 2019.
- Confounding-Robust Policy Evaluation in Infinite-Horizon Reinforcement Learning
Kallus and Zhou. arXiv 2020.
- Off-Policy Evaluation via Off-Policy Classification
Irpan et al. arXiv 2019.
← Back to main page