# Next.js Evals — AI model rankings

Vercel's open eval of how well AI coding agents build and migrate real Next.js apps — measured as the share of tasks the agent completes successfully. Higher is better.

25 tracked models have a published Next.js Evals score. Higher is better. Scores are as published at each model's release.

## Ranking

| Rank | Model | Developer | Score | Released |
| --- | --- | --- | --- | --- |
| 1 | Composer 2.5 | Cursor | 92% | May 18 2026 |
| 1 | Claude Fable 5 | Anthropic | 92% | Jun 9 2026 |
| 1 | GPT-5.6 Sol | OpenAI | 92% | Jun 26 2026 |
| 1 | Kimi K3 | Moonshot AI | 92% | Jul 16 2026 |
| 1 | Grok 4.6 | SpaceXAI | 92% | Aug 12 2026 |
| 6 | Claude Opus 4.8 | Anthropic | 88% | May 28 2026 |
| 6 | GLM-5.2 | Z.ai | 88% | Jun 16 2026 |
| 6 | Claude Opus 5 | Anthropic | 88% | Jul 24 2026 |
| 9 | GPT-5.3-Codex | OpenAI | 83% | Feb 5 2026 |
| 9 | GPT-5.4 | OpenAI | 83% | Mar 5 2026 |
| 9 | GPT-5.5-Pro | OpenAI | 83% | Apr 23 2026 |
| 9 | Grok 4.5 | SpaceXAI | 83% | Jul 8 2026 |
| 13 | Claude Sonnet 5 | Anthropic | 79% | Jun 30 2026 |
| 14 | Claude Opus 4.6 | Anthropic | 75% | Feb 5 2026 |
| 14 | Gemini 3.1 Pro | Google | 75% | Feb 19 2026 |
| 14 | Composer 2 | Cursor | 75% | Mar 19 2026 |
| 14 | GLM-5.1 | Z.ai | 75% | Apr 7 2026 |
| 14 | Claude Opus 4.7 | Anthropic | 75% | Apr 16 2026 |
| 14 | Kimi K2.7 Code | Moonshot AI | 75% | Jun 12 2026 |
| 20 | Gemini 3.0 Pro | Google | 67% | Nov 18 2025 |
| 20 | Composer 1.5 | Cursor | 67% | Feb 9 2026 |
| 20 | Kimi K2.6 | Moonshot AI | 67% | Apr 21 2026 |
| 23 | Claude Sonnet 4.6 | Anthropic | 58% | Feb 17 2026 |
| 24 | Claude Sonnet 4.5 | Anthropic | 50% | Sep 29 2025 |
| 25 | Kimi K2.5 | Moonshot AI | 21% | Jan 27 2026 |


---

Canonical page: https://aireleasetracker.com/benchmark/nextjs-evals
Full dataset: https://aireleasetracker.com/llms-full.txt · JSON: https://aireleasetracker.com/models.json
Source: AI Release Tracker (https://aireleasetracker.com). Benchmark scores are the figures published by the releasing lab at launch.
