Agentic terminal coding

Terminal-Bench 3.0

command-line task completion (v3.0, much harder task set)

Rankings

Higher is better

Terminal-Bench 3.0 — frequently asked questions

What is Terminal-Bench 3.0?
command-line task completion (v3.0, much harder task set)
Which AI model scores highest on Terminal-Bench 3.0?
Grok 4.6 by SpaceXAI holds the best Terminal-Bench 3.0 result among tracked models, at 26% (released Aug 12 2026). Higher scores are better on this benchmark.
What are the top 2 models on Terminal-Bench 3.0?
1. Grok 4.6 (SpaceXAI) — 26%; 2. Grok 4.5 (SpaceXAI) — 15.7%.
How many models have a published Terminal-Bench 3.0 score?
2 tracked models have a published Terminal-Bench 3.0 score. Scores are the figures reported by each lab at that model's release, so this page is a record of results over time rather than a re-run leaderboard.
← All benchmarks