Agentic coding

FrontierCode v1.1 (Extended)extended split

frontier-difficulty agentic coding tasks (v1.1, extended split)

Rankings

Higher is better

FrontierCode v1.1 (Extended) — frequently asked questions

What is FrontierCode v1.1 (Extended)?
frontier-difficulty agentic coding tasks (v1.1, extended split)
Which AI model scores highest on FrontierCode v1.1 (Extended)?
Grok 4.6 by SpaceXAI holds the best FrontierCode v1.1 (Extended) (extended split) result among tracked models, at 61.3% (released Aug 12 2026). Higher scores are better on this benchmark.
What are the top 2 models on FrontierCode v1.1 (Extended)?
1. Grok 4.6 (SpaceXAI) — 61.3%; 2. Grok 4.5 (SpaceXAI) — 56.6%.
How many models have a published FrontierCode v1.1 (Extended) score?
2 tracked models have a published FrontierCode v1.1 (Extended) (extended split) score. Scores are the figures reported by each lab at that model's release, so this page is a record of results over time rather than a re-run leaderboard.
← All benchmarks