# SWE-Bench Verified — AI model rankings

Real coding tasks pulled from open-source projects — the AI has to find and fix actual bugs. A human-checked version of the original SWE-Bench. Higher is better.

57 tracked models have a published SWE-Bench Verified score. Higher is better. Scores come from published lab reports and benchmark sources; recorded sources appear beside the scores.

## Ranking

| Rank | Model | Developer | Score | Source | Released |
| --- | --- | --- | --- | --- | --- |
| 1 | Claude Opus 5 | Anthropic | 96% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Jul 24 2026 |
| 2 | Claude Fable 5 | Anthropic | 95.5% | Lab | Jun 9 2026 |
| 2 | Claude Mythos 5 | Anthropic | 95.5% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Jun 9 2026 |
| 4 | Claude Opus 4.8 | Anthropic | 88.6% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | May 28 2026 |
| 5 | Claude Opus 4.7 | Anthropic | 87.6% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Apr 16 2026 |
| 6 | Claude Sonnet 5 | Anthropic | 85.2% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Jun 30 2026 |
| 7 | GPT-5.3-Codex | OpenAI | 85% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Feb 5 2026 |
| 8 | Claude Opus 4.5 | Anthropic | 80.9% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Nov 24 2025 |
| 9 | Claude Opus 4.6 | Anthropic | 80.8% | Lab | Feb 5 2026 |
| 10 | Gemini 3.1 Pro | Google | 80.6% | Lab | Feb 19 2026 |
| 10 | DeepSeek-V4-Pro-0813 | DeepSeek | 80.6% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Aug 13 2026 |
| 12 | Qwen3.7-Max | Qwen | 80.4% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | May 20 2026 |
| 13 | Kimi K2.6 | Moonshot AI | 80.2% | Lab | Apr 21 2026 |
| 14 | GPT-5.2 | OpenAI | 80% | Lab | Dec 11 2025 |
| 15 | Claude Sonnet 4.6 | Anthropic | 79.6% | Lab | Feb 17 2026 |
| 16 | DeepSeek-V4-Flash-0731 | DeepSeek | 79% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Jul 31 2026 |
| 17 | Qwen3.6-Plus | Qwen | 78.8% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Apr 2 2026 |
| 18 | Gemini 3.0 Flash | Google | 78% | Lab | Dec 17 2025 |
| 19 | GLM-5 | Z.ai | 77.8% | Lab | Feb 12 2026 |
| 20 | Qwen3.7-Plus | Qwen | 77.7% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Jun 1 2026 |
| 21 | Mistral Medium 3.5 | Mistral | 77.6% | Lab | Apr 29 2026 |
| 22 | Muse Spark | Meta | 77.4% | Lab | Apr 8 2026 |
| 23 | Claude Sonnet 4.5 | Anthropic | 77.2% | Lab | Sep 29 2025 |
| 24 | Kimi K2.5 | Moonshot AI | 76.8% | Lab | Jan 27 2026 |
| 25 | Grok 4.20 Beta | SpaceXAI | 76.7% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Feb 17 2026 |
| 26 | Qwen3.5 | Qwen | 76.4% | Lab | Feb 16 2026 |
| 27 | GPT-5.1 | OpenAI | 76.3% | Lab | Nov 12 2025 |
| 28 | Gemini 3.0 Pro | Google | 76.2% | Lab | Nov 18 2025 |
| 29 | Muse Glimmer | Meta | 76% | Lab | Aug 10 2026 |
| 30 | Claude Opus 4.1 | Anthropic | 74.5% | Lab | Aug 5 2025 |
| 31 | GLM-4.7 | Z.ai | 73.8% | Lab | Dec 22 2025 |
| 32 | Qwen3.6 | Qwen | 73.4% | Lab | Apr 16 2026 |
| 33 | Claude Haiku 4.5 | Anthropic | 73.3% | Lab | Oct 15 2025 |
| 34 | Claude Sonnet 4 | Anthropic | 72.7% | Lab | May 22 2025 |
| 35 | Claude Opus 4 | Anthropic | 72.5% | Lab | May 22 2025 |
| 36 | Nemotron 3 Ultra | NVIDIA | 71.9% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Jun 4 2026 |
| 37 | Kimi K2 Thinking | Moonshot AI | 71.3% | Lab | Nov 6 2025 |
| 38 | Grok Code Fast 1 | SpaceXAI | 70.8% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Aug 28 2025 |
| 39 | Qwen3-Coder-Next | Qwen | 70.6% | Lab | Feb 3 2026 |
| 40 | GLM-4.6 | Z.ai | 68% | Lab | Sep 30 2025 |
| 41 | Kimi K2 | Moonshot AI | 65.8% | Lab | Jul 11 2025 |
| 41 | Kimi K2 (0905) | Moonshot AI | 65.8% | Lab | Sep 5 2025 |
| 43 | GLM-4.5 | Z.ai | 64.2% | Lab | Jul 28 2025 |
| 44 | gpt-oss-120b | OpenAI | 62.4% | Lab | Aug 5 2025 |
| 45 | Claude 3.7 Sonnet | Anthropic | 62.3% | Lab | Feb 24 2025 |
| 46 | gpt-oss-20b | OpenAI | 60.7% | Lab | Aug 5 2025 |
| 47 | Nemotron 3 Super | NVIDIA | 60.5% | Lab | Mar 11 2026 |
| 48 | GLM-4.5-Air | Z.ai | 59.8% | Lab | Jul 28 2025 |
| 49 | Gemini 2.5 Pro | Google | 59.6% | Lab | Mar 25 2025 |
| 50 | GPT-4.1 | OpenAI | 54.6% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Apr 14 2025 |
| 51 | Nemotron 3.5 Lightning | NVIDIA | 51.6% | Lab | Aug 11 2026 |
| 52 | o3-mini | OpenAI | 49.3% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Jan 31 2025 |
| 53 | Claude 3.5 Sonnet (upgraded) | Anthropic | 49% | Lab | Oct 22 2024 |
| 54 | Claude 3.5 Haiku | Anthropic | 40.6% | Lab | Oct 22 2024 |
| 55 | Claude 3.5 Sonnet | Anthropic | 33.4% | Lab | Jun 20 2024 |
| 56 | Claude 3 Opus | Anthropic | 33% | Lab | Mar 4 2024 |
| 57 | GPT-4.1 mini | OpenAI | 23.6% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Apr 14 2025 |


---

Canonical page: https://aireleasetracker.com/benchmark/swe-bench-verified
Full dataset: https://aireleasetracker.com/llms-full.txt · JSON: https://aireleasetracker.com/models.json
Source: AI Release Tracker (https://aireleasetracker.com). Most benchmark scores come from lab launch material; gathered results identify the leaderboard that published them.
