# Next.js Evals — AI model rankings

Vercel's open eval of how well AI coding agents build and migrate real Next.js apps — measured as the share of tasks the agent completes successfully. Higher is better.

Scores from [Next.js Evals](https://nextjs.org/evals), which runs the benchmark and publishes the full field.

32 tracked models have a published Next.js Evals score. Higher is better. Scores are gathered from Next.js Evals; recorded retrieval dates appear beside the scores.

## Ranking

| Rank | Model | Developer | Score | Source | Released |
| --- | --- | --- | --- | --- | --- |
| 1 | Claude Fable 5.1 | Anthropic | 97% | [Next.js Evals](https://nextjs.org/evals) | Sep 1 2026 |
| 1 | GPT-6 Sol | OpenAI | 97% | [Next.js Evals](https://nextjs.org/evals) | Sep 22 2026 |
| 1 | Claude Opus 5.5 | Anthropic | 97% | [Next.js Evals](https://nextjs.org/evals) | Sep 22 2026 |
| 4 | Claude Opus 5 | Anthropic | 94% | [Next.js Evals](https://nextjs.org/evals) | Jul 24 2026 |
| 4 | Grok 4.7 | SpaceXAI | 94% | [Next.js Evals](https://nextjs.org/evals) | Sep 21 2026 |
| 6 | Gemini 3.8 Flash | Google | 90% | [Next.js Evals](https://nextjs.org/evals) | Sep 2 2026 |
| 6 | GPT-6 Astra | OpenAI | 90% | [Next.js Evals](https://nextjs.org/evals) | Sep 3 2026 |
| 8 | Kimi K3 | Moonshot AI | 84% | [Next.js Evals](https://nextjs.org/evals) | Jul 16 2026 |
| 9 | Composer 2.5 | SpaceXAI | 81% | [Next.js Evals](https://nextjs.org/evals) | May 18 2026 |
| 9 | GLM-5.2 | Z.ai | 81% | [Next.js Evals](https://nextjs.org/evals) | Jun 16 2026 |
| 9 | Claude Sonnet 5 | Anthropic | 81% | [Next.js Evals](https://nextjs.org/evals) | Jun 30 2026 |
| 12 | Claude Fable 5 | Anthropic | 77% | [Next.js Evals](https://nextjs.org/evals) | Jun 9 2026 |
| 12 | GPT-5.6 Sol | OpenAI | 77% | [Next.js Evals](https://nextjs.org/evals) | Jun 26 2026 |
| 12 | GPT-6 Luna | OpenAI | 77% | [Next.js Evals](https://nextjs.org/evals) | Sep 22 2026 |
| 15 | Kimi K2.7 Code | Moonshot AI | 74% | [Next.js Evals](https://nextjs.org/evals) | Jun 12 2026 |
| 16 | Grok 4.6 | SpaceXAI | 71% | [Next.js Evals](https://nextjs.org/evals) | Aug 12 2026 |
| 17 | GPT-5.3-Codex | OpenAI | 68% | [Next.js Evals](https://nextjs.org/evals) | Feb 5 2026 |
| 17 | Claude Opus 4.8 | Anthropic | 68% | [Next.js Evals](https://nextjs.org/evals) | May 28 2026 |
| 19 | Composer 1.5 | SpaceXAI | 67% | [Next.js Evals](https://nextjs.org/evals) | Feb 9 2026 |
| 20 | GPT-5.4 | OpenAI | 65% | [Next.js Evals](https://nextjs.org/evals) | Mar 5 2026 |
| 20 | GPT-5.5-Pro | OpenAI | 65% | [Next.js Evals](https://nextjs.org/evals) | Apr 23 2026 |
| 20 | Grok 4.5 | SpaceXAI | 65% | [Next.js Evals](https://nextjs.org/evals) | Jul 8 2026 |
| 23 | Claude Opus 4.6 | Anthropic | 58% | [Next.js Evals](https://nextjs.org/evals) | Feb 5 2026 |
| 23 | Gemini 3.1 Pro | Google | 58% | [Next.js Evals](https://nextjs.org/evals) | Feb 19 2026 |
| 23 | Composer 2 | SpaceXAI | 58% | [Next.js Evals](https://nextjs.org/evals) | Mar 19 2026 |
| 23 | GLM-5.1 | Z.ai | 58% | [Next.js Evals](https://nextjs.org/evals) | Apr 7 2026 |
| 23 | Claude Opus 4.7 | Anthropic | 58% | [Next.js Evals](https://nextjs.org/evals) | Apr 16 2026 |
| 28 | Gemini 3.0 Pro | Google | 52% | [Next.js Evals](https://nextjs.org/evals) | Nov 18 2025 |
| 28 | Kimi K2.6 | Moonshot AI | 52% | [Next.js Evals](https://nextjs.org/evals) | Apr 21 2026 |
| 30 | Claude Sonnet 4.6 | Anthropic | 45% | [Next.js Evals](https://nextjs.org/evals) | Feb 17 2026 |
| 31 | Claude Sonnet 4.5 | Anthropic | 39% | [Next.js Evals](https://nextjs.org/evals) | Sep 29 2025 |
| 32 | Kimi K2.5 | Moonshot AI | 16% | [Next.js Evals](https://nextjs.org/evals) | Jan 27 2026 |


---

Canonical page: https://aireleasetracker.com/benchmark/nextjs-evals
Site index: https://aireleasetracker.com/llms.txt
Source: AI Release Tracker (https://aireleasetracker.com). Most benchmark scores come from lab launch material; gathered results identify the leaderboard that published them.
