Claude Sonnet 4.5vsGrok 4.5

Claude Sonnet 4.5
Grok 4.5
Benchmarks
Nonsense detection
BullshitBench v2
79%Best
54%
Prompt injection robustness
Gray Swan IPI · k = 1
13.4%
Prompt injection robustness
Gray Swan IPI · k = 10
54.2%
Prompt injection robustness
Gray Swan IPI · k = 15
60.8%
Agentic coding
SWE-Bench Pro
64.7%
Coding
SWE-Bench Verified
77.2%
Multilingual coding
SWE-Bench Multilingual
78%
Agentic coding
CursorBench v3.2
66.7%
Agentic coding
DeepSWE 1.1
54%
Agentic coding
DeepSWE 1.0
62%
Next.js coding
Next.js Evals
50%
83%Best
Agentic computer work
Frontier-Bench v0.1
17.8%
Agentic terminal coding
Terminal-Bench 2.1
83.3%
Science
GPQA Diamond
83.4%
Agentic legal work
Harvey's Legal Agent Benchmark
12.92%
Medical admin work
MedScribe
86.88%
Multimodal
MMMU
68%
Community preference (code)
Arena Elo (Code)
1549
Overview
CompanyAnthropicSpaceXAI
Release dateSep 29 2025Jul 8 2026
AccessProprietaryProprietary

Which is better: Claude Sonnet 4.5 or Grok 4.5?

Claude Sonnet 4.5 and Grok 4.5 are evenly matched across the 2 benchmarks they both report (BullshitBench v2, Next.js Evals). Claude Sonnet 4.5 shipped 282 days before Grok 4.5, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On BullshitBench v2, Claude Sonnet 4.5 leads at 79% vs Grok 4.5 at 54%. On Next.js Evals, Grok 4.5 leads at 83% vs Claude Sonnet 4.5 at 50%.

Frequently asked questions

Claude Sonnet 4.5 was released by Anthropic on Sep 29 2025.

Grok 4.5 was released by SpaceXAI on Jul 8 2026.

Grok 4.5 leads on Next.js Evals — Claude Sonnet 4.5 50% vs Grok 4.5 83%.

Other comparisons