Claude Opus 4.6vsGrok 4.5

Claude Opus 4.6
Grok 4.5
Benchmarks
Nonsense detection
BullshitBench v2
87%Best
54%
Prompt injection robustness
Gray Swan IPI · k = 1
13.4%
Prompt injection robustness
Gray Swan IPI · k = 10
54.2%
Prompt injection robustness
Gray Swan IPI · k = 15
60.8%
Agentic coding
SWE-Bench Pro
64.7%
Coding
SWE-Bench Verified
80.8%
Multilingual coding
SWE-Bench Multilingual
78%
Agentic coding
CursorBench v3.2
66.7%
Agentic coding
DeepSWE 1.1
54%
Agentic coding
DeepSWE 1.0
62%
Next.js coding
Next.js Evals
75%
83%Best
Agentic computer work
Frontier-Bench v0.1
17.8%
Agentic terminal coding
Terminal-Bench 2.1
83.3%
Web browsing
BrowseComp
83.7%
Multidisciplinary reasoning
Humanity's Last Exam · with tools
53%
Science
GPQA Diamond
91.3%
Agentic legal work
Harvey's Legal Agent Benchmark
12.92%
Medical admin work
MedScribe
86.88%
Community preference
Arena Elo (Text)
1504Best
1468
Community preference (code)
Arena Elo (Code)
1543
1549Best
Overview
CompanyAnthropicSpaceXAI
Release dateFeb 5 2026Jul 8 2026
AccessProprietaryProprietary

Which is better: Claude Opus 4.6 or Grok 4.5?

Claude Opus 4.6 and Grok 4.5 are evenly matched across the 4 benchmarks they both report (BullshitBench v2, Next.js Evals, Arena Elo (Text), Arena Elo (Code)). Claude Opus 4.6 shipped 153 days before Grok 4.5, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On BullshitBench v2, Claude Opus 4.6 leads at 87% vs Grok 4.5 at 54%. On Next.js Evals, Grok 4.5 leads at 83% vs Claude Opus 4.6 at 75%. On Arena Elo (Text), Claude Opus 4.6 leads at 1504 vs Grok 4.5 at 1468. On Arena Elo (Code), Grok 4.5 leads at 1549 vs Claude Opus 4.6 at 1543.

Frequently asked questions

Claude Opus 4.6 was released by Anthropic on Feb 5 2026.

Grok 4.5 was released by SpaceXAI on Jul 8 2026.

Grok 4.5 leads on Next.js Evals — Claude Opus 4.6 75% vs Grok 4.5 83%.

Other comparisons