Reward Learning & Reward Modeling Reading List

Curated by Mouhssine Rifaki | Stanford Electrical Engineering | Last updated August 2026

Core papers on learning reward functions from data — from inverse RL and preference-based RL to modern reward modeling for RLHF and alignment.

Reward Learning & Reward Modeling: 10 key papers

  1. Inverse Reward Design
    Hadfield-Menell et al. arXiv 2017.
  2. Reward learning from human preferences and demonstrations in Atari
    Ibarz et al. arXiv 2018.
  3. Reward-rational (implicit) choice: A unifying formalism for reward learning
    Jeon et al. arXiv 2020.
  4. The Effects of Reward Misspecification: Mapping and Mitigating Misaligned Models
    Pan et al. arXiv 2022.
  5. Defining and Characterizing Reward Hacking
    Skalse et al. arXiv 2022.
  6. Understanding Learned Reward Functions
    Michaud et al. arXiv 2020.
  7. Quantifying Differences in Reward Functions
    Gleave et al. arXiv 2020.
  8. Learning to Understand Goal Specifications by Modelling Reward
    Bahdanau et al. arXiv 2018.
  9. Reward Shaping via Meta-Learning
    Zou et al. arXiv 2019.
  10. Reward Model Ensembles Help Mitigate Overoptimization
    Coste et al. arXiv 2023.
← Back to main page