Reward Learning & Reward Modeling Reading List
Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026
Core papers on learning reward functions from data — from inverse RL and preference-based RL to modern reward modeling for RLHF and alignment.
Reward Learning & Reward Modeling: 10 key papers
- Inverse Reward Design
Hadfield-Menell et al. arXiv 2017.
- Reward learning from human preferences and demonstrations in Atari
Ibarz et al. arXiv 2018.
- Reward-rational (implicit) choice: A unifying formalism for reward learning
Jeon et al. arXiv 2020.
- The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models
Pan et al. arXiv 2022.
- Defining and Characterizing Reward Hacking
Skalse et al. arXiv 2022.
- Understanding Learned Reward Functions
Michaud et al. arXiv 2020.
- Quantifying Differences in Reward Functions
Gleave et al. arXiv 2020.
- Learning to Understand Goal Specifications by Modelling Reward
Bahdanau et al. arXiv 2018.
- Reward Shaping via Meta-Learning
Zou et al. arXiv 2019.
- Reward Model Ensembles Help Mitigate Overoptimization
Coste et al. arXiv 2023.
← Back to main page