The 2017 paper "Deep Reinforcement Learning from Human Preferences" by Paul Christiano et al. dem..., Sonic AI
“The 2017 paper "Deep Reinforcement Learning from Human Preferences" by Paul Christiano et al. demonstrated that learning from pairwise human preferences could solve basic RL tasks, in some cases achieving higher rewards than standard RL methods.”