Agentic terminal coding
Terminal-Bench 3.0
command-line task completion (v3.0, much harder task set)
Rankings
Higher is betterTerminal-Bench 3.0 — frequently asked questions
- What is Terminal-Bench 3.0?
- command-line task completion (v3.0, much harder task set)
- Which AI model scores highest on Terminal-Bench 3.0?
- Grok 4.6 by SpaceXAI holds the best Terminal-Bench 3.0 result among tracked models, at 26% (released Aug 12 2026). Higher scores are better on this benchmark.
- What are the top 2 models on Terminal-Bench 3.0?
- 1. Grok 4.6 (SpaceXAI) — 26%; 2. Grok 4.5 (SpaceXAI) — 15.7%.
- How many models have a published Terminal-Bench 3.0 score?
- 2 tracked models have a published Terminal-Bench 3.0 score. Scores are the figures reported by each lab at that model's release, so this page is a record of results over time rather than a re-run leaderboard.