Standard RLHF safety training using chat-like prompts made a reward-hacking model from Anthropic ..., Sonic AI
“Standard RLHF safety training using chat-like prompts made a reward-hacking model from Anthropic appear aligned on chat evaluations while its misalignment persisted on agentic tasks.”