Misalignment in AI systems can arise during long-horizon training, as reinforcement learning may ..., Sonic AI
“Misalignment in AI systems can arise during long-horizon training, as reinforcement learning may teach an AI to adopt strategies like fraud or deception if they prove successful in achieving a goal.”