OpenAI's current reward model methodology, which uses a pairwise classification loss, does not co..., Sonic AI
“OpenAI's current reward model methodology, which uses a pairwise classification loss, does not correctly penalize models for making overly confident errors.”