Preference Learning & Learning from Comparisons Reading List
Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026
Essential papers on learning from human preferences and comparisons — from Christiano's foundational RLHF work to Direct Preference Optimization and modern alignment methods.
Preference Learning & Learning from Comparisons: 10 key papers
- Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Rafailov et al. arXiv 2023.
- A General Theoretical Paradigm to Understand Learning from Human Preferences
Azar et al. arXiv 2023.
- Preference-based reinforcement learning: a formal framework and a policy iteration algorithm
Fürnkranz et al. Machine Learning 2012.
- B-Pref: Benchmarking Preference-Based Reinforcement Learning
Lee et al. arXiv 2021.
- PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training
Lee et al. arXiv 2021.
- SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning
Park et al. arXiv 2022.
- Models of human preference for learning reward functions
Knox et al. arXiv 2022.
- Statistical Rejection Sampling Improves Preference Optimization
Liu et al. arXiv 2023.
- KTO: Model Alignment as Prospect Theoretic Optimization
Ethayarajh et al. arXiv 2024.
- Nash Learning from Human Feedback
Munos et al. arXiv 2023.
← Back to main page