On the PaperBench benchmark, Claude 3.5 Sonnet achieved about a 21% score on replicating research..., Sonic AI
“On the PaperBench benchmark, Claude 3.5 Sonnet achieved about a 21% score on replicating research papers, which did not outperform human ML PhD students.”