“OpenAI's alignment research includes training deceptively aligned models to stress-test its evaluation methods.”