# ARC-AGI-2 — AI model rankings

Puzzle-style tests of abstract reasoning and pattern-finding — the kind of thing people find easy but AIs often struggle with. Higher is better.

21 tracked models have a published ARC-AGI-2 score. Higher is better. Scores come from published lab reports and benchmark sources; recorded sources appear beside the scores.

## Ranking

| Rank | Model | Developer | Score | Source | Released |
| --- | --- | --- | --- | --- | --- |
| 1 | GPT-6 Astra | OpenAI | 95% | [BenchLM](https://benchlm.ai), retrieved 2026-09-07 | Sep 3 2026 |
| 2 | GPT-5.6 Sol | OpenAI | 92.5% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Jun 26 2026 |
| 3 | Claude Opus 5 | Anthropic | 90.4% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Jul 24 2026 |
| 4 | Claude Fable 5.1 | Anthropic | 90% | Lab | Sep 1 2026 |
| 5 | GPT-5.5 | OpenAI | 84.6% | Lab | Apr 23 2026 |
| 6 | GPT-5.6 Terra | OpenAI | 83.9% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Jun 26 2026 |
| 7 | GPT-5.4-Pro | OpenAI | 83.3% | [BenchLM](https://benchlm.ai), retrieved 2026-07-11 | Mar 5 2026 |
| 8 | Gemini 3.1 Pro | Google | 77.1% | Lab | Feb 19 2026 |
| 9 | Claude Opus 4.7 | Anthropic | 75.8% | Lab | Apr 16 2026 |
| 10 | GPT-5.4 | OpenAI | 73.95% | [BenchLM](https://benchlm.ai), retrieved 2026-08-24 | Mar 5 2026 |
| 11 | Gemini 3.5 Flash | Google | 72.1% | Lab | May 19 2026 |
| 12 | Claude Opus 4.8 | Anthropic | 72.08% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | May 28 2026 |
| 13 | GPT-5.6 Luna | OpenAI | 59.54% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Jun 26 2026 |
| 14 | Claude Sonnet 4.6 | Anthropic | 58.3% | Lab | Feb 17 2026 |
| 15 | Grok 4.20 Beta | SpaceXAI | 53.3% | [BenchLM](https://benchlm.ai), retrieved 2026-07-11 | Feb 17 2026 |
| 16 | GPT-5.2 | OpenAI | 52.9% | [BenchLM](https://benchlm.ai), retrieved 2026-07-11 | Dec 11 2025 |
| 17 | Grok 4.5 | SpaceXAI | 52.64% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Jul 8 2026 |
| 18 | Muse Spark | Meta | 42.5% | [BenchLM](https://benchlm.ai), retrieved 2026-07-11 | Apr 8 2026 |
| 19 | Gemini 3.0 Flash | Google | 33.6% | Lab | Dec 17 2025 |
| 20 | Gemini 3.0 Pro | Google | 31.1% | [BenchLM](https://benchlm.ai), retrieved 2026-07-11 | Nov 18 2025 |
| 21 | Claude Sonnet 4.5 | Anthropic | 13.6% | [BenchLM](https://benchlm.ai), retrieved 2026-08-31 | Sep 29 2025 |


---

Canonical page: https://aireleasetracker.com/benchmark/arc-agi-2
Full dataset: https://aireleasetracker.com/llms-full.txt · JSON: https://aireleasetracker.com/models.json
Source: AI Release Tracker (https://aireleasetracker.com). Most benchmark scores come from lab launch material; gathered results identify the leaderboard that published them.
