RL from Human Feedback (RLHF) Reading List
Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026
Training language models and agents from human preferences instead of hand-designed reward functions.
RL from Human Feedback (RLHF): 10 key papers
- Deep reinforcement learning from human preferences
Christiano et al. arXiv 2017.
- Learning to summarize from human feedback
Stiennon et al. arXiv 2020.
- Fine-Tuning Language Models from Human Preferences
Ziegler et al. arXiv 2019.
- Constitutional AI: Harmlessness from AI Feedback
Bai et al. arXiv 2022.
- Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
Bai et al. arXiv 2022.
- Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback
Casper et al. arXiv 2023.
- Secrets of RLHF in Large Language Models Part I: PPO
Zheng et al. arXiv 2023.
- Scaling Laws for Reward Model Overoptimization
Gao et al. arXiv 2022.
- RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback
Lee et al. arXiv 2023.
- Fine-Grained Human Feedback Gives Better Rewards for Language Model Training
Wu et al. arXiv 2023.
← Back to main page