# SWE-Bench Verified — AI model rankings

Real coding tasks pulled from open-source projects — the AI has to find and fix actual bugs. A human-checked version of the original SWE-Bench. Higher is better.

36 tracked models have a published SWE-Bench Verified score. Higher is better. Scores are as published at each model's release.

## Ranking

| Rank | Model | Developer | Score | Released |
| --- | --- | --- | --- | --- |
| 1 | Claude Fable 5 | Anthropic | 95.5% | Jun 9 2026 |
| 2 | Claude Opus 4.7 | Anthropic | 87.6% | Apr 16 2026 |
| 3 | Claude Opus 4.5 | Anthropic | 80.9% | Nov 24 2025 |
| 4 | Claude Opus 4.6 | Anthropic | 80.8% | Feb 5 2026 |
| 5 | Gemini 3.1 Pro | Google | 80.6% | Feb 19 2026 |
| 6 | Kimi K2.6 | Moonshot AI | 80.2% | Apr 21 2026 |
| 7 | GPT-5.2 | OpenAI | 80% | Dec 11 2025 |
| 8 | Claude Sonnet 4.6 | Anthropic | 79.6% | Feb 17 2026 |
| 9 | Gemini 3.0 Flash | Google | 78% | Dec 17 2025 |
| 10 | GLM-5 | Z.ai | 77.8% | Feb 12 2026 |
| 11 | Mistral Medium 3.5 | Mistral | 77.6% | Apr 29 2026 |
| 12 | Muse Spark | Meta | 77.4% | Apr 8 2026 |
| 13 | Claude Sonnet 4.5 | Anthropic | 77.2% | Sep 29 2025 |
| 14 | Kimi K2.5 | Moonshot AI | 76.8% | Jan 27 2026 |
| 15 | Qwen3.5 | Qwen | 76.4% | Feb 16 2026 |
| 16 | GPT-5.1 | OpenAI | 76.3% | Nov 12 2025 |
| 17 | Gemini 3.0 Pro | Google | 76.2% | Nov 18 2025 |
| 18 | Claude Opus 4.1 | Anthropic | 74.5% | Aug 5 2025 |
| 19 | GLM-4.7 | Z.ai | 73.8% | Dec 22 2025 |
| 20 | Qwen3.6 | Qwen | 73.4% | Apr 16 2026 |
| 21 | Claude Haiku 4.5 | Anthropic | 73.3% | Oct 15 2025 |
| 22 | Claude Sonnet 4 | Anthropic | 72.7% | May 22 2025 |
| 23 | Claude Opus 4 | Anthropic | 72.5% | May 22 2025 |
| 24 | Kimi K2 Thinking | Moonshot AI | 71.3% | Nov 6 2025 |
| 25 | Qwen3-Coder-Next | Qwen | 70.6% | Feb 3 2026 |
| 26 | GLM-4.6 | Z.ai | 68% | Sep 30 2025 |
| 27 | Kimi K2 | Moonshot AI | 65.8% | Jul 11 2025 |
| 27 | Kimi K2 (0905) | Moonshot AI | 65.8% | Sep 5 2025 |
| 29 | GLM-4.5 | Z.ai | 64.2% | Jul 28 2025 |
| 30 | Claude 3.7 Sonnet | Anthropic | 62.3% | Feb 24 2025 |
| 31 | GLM-4.5-Air | Z.ai | 59.8% | Jul 28 2025 |
| 32 | Gemini 2.5 Pro | Google | 59.6% | Mar 25 2025 |
| 33 | Claude 3.5 Sonnet (upgraded) | Anthropic | 49% | Oct 22 2024 |
| 34 | Claude 3.5 Haiku | Anthropic | 40.6% | Oct 22 2024 |
| 35 | Claude 3.5 Sonnet | Anthropic | 33.4% | Jun 20 2024 |
| 36 | Claude 3 Opus | Anthropic | 33% | Mar 4 2024 |


---

Canonical page: https://aireleasetracker.com/benchmark/swe-bench-verified
Full dataset: https://aireleasetracker.com/llms-full.txt · JSON: https://aireleasetracker.com/models.json
Source: AI Release Tracker (https://aireleasetracker.com). Benchmark scores are the figures published by the releasing lab at launch.
