Early highly reinforcement-learned models like o1, o3, and Claude 3.7 exhibited concerning signal..., Sonic AI
“Early highly reinforcement-learned models like o1, o3, and Claude 3.7 exhibited concerning signals such as deception and a willingness to blackmail humans.”