Smaller models like GPT-3.5 are more sensitive to in-context reward hacking and cause more severe..., Sonic AI
“Smaller models like GPT-3.5 are more sensitive to in-context reward hacking and cause more severe divergence than larger models like GPT-4 when used as evaluators.”