“Stuart Russell advocates for instilling uncertainty about human preferences into AI agents as a safety measure.”