Claude Opus 4.7vsGrok 4.20 Beta

Claude Opus 4.7
Grok 4.20 Beta
Specifications
Context window
1M
Benchmarks
Nonsense detection
BullshitBench v2
83%Best
56%
Agentic coding
SWE-Bench Pro
64.3%
Coding
SWE-Bench Verified
87.6%
Multilingual coding
SWE-Bench Multilingual
80.5%
Agentic coding
CursorBench v3.1
64.8%
Next.js coding
Next.js Evals
75%
Agentic terminal coding
Terminal-Bench 2.1
66.1%
Agentic terminal coding
Terminal-Bench 2.0
69.4%
Multi-step tool use
MCP Atlas
79.1%
Web browsing
BrowseComp
79.3%
Cybersecurity
CyberGym
73.1%
Multidisciplinary reasoning
Humanity's Last Exam · no tools
46.9%
Multidisciplinary reasoning
Humanity's Last Exam · with tools
54.7%
Abstract reasoning
ARC-AGI-2
75.8%Best
53.3%
Advanced math
FrontierMath · Tier 1–3
43.8%
Advanced math
FrontierMath · Tier 4
22.9%
Science
GPQA Diamond
94.2%
Agentic computer use
OSWorld-Verified
78%
Agentic financial analysis
Finance Agent v2
51.5%
Knowledge work
GDPval-AA
1753
Knowledge work
GDPval (win/tie rate)
80.3%
Chart reasoning
CharXiv Reasoning
82.1%
Multimodal reasoning
MMMU-Pro
75.2%
Spatial reasoning
Blueprint-Bench 2
24.5%
Long context
MRCR v2 (8-needle) · 128k average
59.3%
Community preference
Arena Elo (Text)
1503Best
1475
Community preference (code)
Arena Elo (Code)
1557
Overview
CompanyAnthropicSpaceXAI
Release dateApr 16 2026Feb 17 2026
AccessProprietaryProprietary

Which is better: Claude Opus 4.7 or Grok 4.20 Beta?

Claude Opus 4.7 leads Grok 4.20 Beta on 3 of the 3 benchmarks they both report (BullshitBench v2, ARC-AGI-2, Arena Elo (Text)). Grok 4.20 Beta shipped 58 days before Claude Opus 4.7, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On BullshitBench v2, Claude Opus 4.7 leads at 83% vs Grok 4.20 Beta at 56%. On ARC-AGI-2, Claude Opus 4.7 leads at 75.8% vs Grok 4.20 Beta at 53.3%. On Arena Elo (Text), Claude Opus 4.7 leads at 1503 vs Grok 4.20 Beta at 1475.

Frequently asked questions

Claude Opus 4.7 was released by Anthropic on Apr 16 2026.

Grok 4.20 Beta was released by SpaceXAI on Feb 17 2026.

Claude Opus 4.7 leads on ARC-AGI-2 — Claude Opus 4.7 75.8% vs Grok 4.20 Beta 53.3%.

Other comparisons