Coding
SWE-Bench Verified
Real coding tasks pulled from open-source projects — the AI has to find and fix actual bugs. A human-checked version of the original SWE-Bench. Higher is better.
Rankings
Higher is better#196%
Claude Opus 5via BenchLM
295.5%
Claude Fable 5
295.5%
Claude Mythos 5via BenchLM
488.6%
Claude Opus 4.8via BenchLM
587.6%
Claude Opus 4.7via BenchLM
685.2%
Claude Sonnet 5via BenchLM
785%
GPT-5.3-Codexvia BenchLM
880.9%
Claude Opus 4.5via BenchLM
980.8%
Claude Opus 4.6
1080.6%
Gemini 3.1 Pro
1080.6%
DeepSeek-V4-Pro-0813via BenchLM
1280.4%
Qwen3.7-Maxvia BenchLM
1380.2%
Kimi K2.6
1480%
GPT-5.2
1579.6%
Claude Sonnet 4.6
1679%
DeepSeek-V4-Flash-0731via BenchLM
1778.8%
Qwen3.6-Plusvia BenchLM
1878%
Gemini 3.0 Flash
1977.8%
GLM-5
2077.7%
Qwen3.7-Plusvia BenchLM
2177.6%
Mistral Medium 3.5
2277.4%
Muse Spark
2377.2%
Claude Sonnet 4.5
2476.8%
Kimi K2.5
2576.7%
Grok 4.20 Betavia BenchLM
2676.4%
Qwen3.5OW
2776.3%
GPT-5.1
2876.2%
Gemini 3.0 Pro
2976%
Muse GlimmerOW
3074.5%
Claude Opus 4.1
3173.8%
GLM-4.7
3273.4%
Qwen3.6OW
3373.3%
Claude Haiku 4.5
3472.7%
Claude Sonnet 4
3572.5%
Claude Opus 4
3671.9%
Nemotron 3 UltraOSvia BenchLM
3771.3%
Kimi K2 Thinking
3870.8%
Grok Code Fast 1via BenchLM
3970.6%
Qwen3-Coder-NextOW
4068%
GLM-4.6
4165.8%
Kimi K2
4165.8%
Kimi K2 (0905)
4364.2%
GLM-4.5
4462.4%
gpt-oss-120bOW
4562.3%
Claude 3.7 Sonnet
4660.7%
gpt-oss-20bOW
4760.5%
Nemotron 3 SuperOS
4859.8%
GLM-4.5-Air
4959.6%
Gemini 2.5 Pro
5054.6%
GPT-4.1via BenchLM
5151.6%
Nemotron 3.5 LightningOS
5249.3%
o3-minivia BenchLM
5349%
Claude 3.5 Sonnet (upgraded)
5440.6%
Claude 3.5 Haiku
5533.4%
Claude 3.5 Sonnet
5633%
Claude 3 Opus
5723.6%
GPT-4.1 minivia BenchLM
Scores marked “via” above are quoted with attribution from BenchLM, retrieved 31 August 2026.
SWE-Bench Verified — frequently asked questions
Real coding tasks pulled from open-source projects — the AI has to find and fix actual bugs. A human-checked version of the original SWE-Bench. Higher is better.