Agentic coding
FrontierCode v1.1 (Extended)extended split
frontier-difficulty agentic coding tasks (v1.1, extended split)
Rankings
Higher is betterFrontierCode v1.1 (Extended) — frequently asked questions
- What is FrontierCode v1.1 (Extended)?
- frontier-difficulty agentic coding tasks (v1.1, extended split)
- Which AI model scores highest on FrontierCode v1.1 (Extended)?
- Grok 4.6 by SpaceXAI holds the best FrontierCode v1.1 (Extended) (extended split) result among tracked models, at 61.3% (released Aug 12 2026). Higher scores are better on this benchmark.
- What are the top 2 models on FrontierCode v1.1 (Extended)?
- 1. Grok 4.6 (SpaceXAI) — 61.3%; 2. Grok 4.5 (SpaceXAI) — 56.6%.
- How many models have a published FrontierCode v1.1 (Extended) score?
- 2 tracked models have a published FrontierCode v1.1 (Extended) (extended split) score. Scores are the figures reported by each lab at that model's release, so this page is a record of results over time rather than a re-run leaderboard.