Compare AI models

Benchmarks
SWE-Bench Verified
49%72.5%
Overview
CompanyAnthropicAnthropic
Release dateOct 22 2024May 22 2025
AccessClosedClosed
Model detailsView modelView model

Frequently asked questions

Claude Opus 4 leads Claude 3.5 Sonnet (upgraded) on 1 of the 1 benchmark they both report (SWE-Bench Verified). Claude 3.5 Sonnet (upgraded) shipped 212 days before Claude Opus 4, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On SWE-Bench Verified, Claude Opus 4 leads at 72.5% vs Claude 3.5 Sonnet (upgraded) at 49%.