Gemini 3.1 ProvsGrok 4.5

Gemini 3.1 Pro
Grok 4.5
API pricing
Input price
$2.00$2.00
Output price
$12.00$6.00
Cached input price
$0.20$0.30
Benchmarks
BullshitBench v2
37%54%
Gray Swan IPI · k = 1
14.2%13.4%
Gray Swan IPI · k = 10
45.7%54.2%
Gray Swan IPI · k = 15
49.2%60.8%
SWE-Bench Pro
54.2%64.7%
DeepSWE 1.1
12%54%
Next.js Evals
75%83%
Terminal-Bench 2.1
70.3%83.3%
GDPval-AA v2
9651526
Arena Elo (Text)
14851468
Arena Elo (Code)
14451555
Benchmarks
SWE-Bench Verified
80.6%
SWE-Bench Multilingual
78%
CursorBench v3.2
66.7%
DeepSWE 1.0
62%
FrontierCode v1.1 (Extended) · extended split
56.6%
APEX-SWE
53.6%
MLE-Bench
42.6%
Frontier-Bench v0.1
17.8%
Terminal-Bench 3.0
15.7%
Terminal-Bench 2.0
68.5%
APEX-Agents
47.1%
MCP Atlas
78.2%
Toolathlon
48.8%
BrowseComp
85.9%
Humanity's Last Exam · no tools
44.4%
Humanity's Last Exam · with tools
51.4%
ARC-AGI-2
77.1%
FrontierMath · Tier 1–3
36.9%
FrontierMath · Tier 4
16.7%
GPQA Diamond
94.3%
OSWorld-Verified
76.2%
Finance Agent v2
43%
Harvey's Legal Agent Benchmark
12.92%
MedScribe
86.88%
AA Intelligence Index
56
GDPval-AA
1314
AA-Briefcase
1313
GDPval (win/tie rate)
67.3%
CharXiv Reasoning
83.3%
MMMU-Pro
80.5%
Blueprint-Bench 2
26.5%
MRCR v2 (8-needle) · 128k average
84.9%
MRCR v2 (8-needle) · 1M pointwise
26.3%
Overview
CompanyGoogleSpaceXAI
Release dateFeb 19 2026Jul 8 2026
AccessProprietaryProprietary

Frequently asked questions

Grok 4.5 leads Gemini 3.1 Pro on 8 of the 11 benchmarks they both report. Both charge $2.00 per million input tokens. Grok 4.5 is cheaper on output: $6.00 vs $12.00 per million tokens. Figures are base-tier rates. Gemini 3.1 Pro shipped 139 days before Grok 4.5, so benchmark comparisons should account for the intervening progress.

Published specifications for these two models are limited — see each model page for the latest details.

On BullshitBench v2, Grok 4.5 leads at 54% vs Gemini 3.1 Pro at 37%. On Gray Swan IPI · k = 1, Grok 4.5 leads at 13.4% vs Gemini 3.1 Pro at 14.2%. On Gray Swan IPI · k = 10, Gemini 3.1 Pro leads at 45.7% vs Grok 4.5 at 54.2%. On Gray Swan IPI · k = 15, Gemini 3.1 Pro leads at 49.2% vs Grok 4.5 at 60.8%. On SWE-Bench Pro, Grok 4.5 leads at 64.7% vs Gemini 3.1 Pro at 54.2%. On DeepSWE 1.1, Grok 4.5 leads at 54% vs Gemini 3.1 Pro at 12%. On Next.js Evals, Grok 4.5 leads at 83% vs Gemini 3.1 Pro at 75%. On Terminal-Bench 2.1, Grok 4.5 leads at 83.3% vs Gemini 3.1 Pro at 70.3%. On GDPval-AA v2, Grok 4.5 leads at 1526 vs Gemini 3.1 Pro at 965. On Arena Elo (Text), Gemini 3.1 Pro leads at 1485 vs Grok 4.5 at 1468. On Arena Elo (Code), Grok 4.5 leads at 1555 vs Gemini 3.1 Pro at 1445.

Gemini 3.1 Pro was released by Google on Feb 19 2026.

Grok 4.5 was released by SpaceXAI on Jul 8 2026.

Grok 4.5 leads on SWE-Bench Pro — Gemini 3.1 Pro 54.2% vs Grok 4.5 64.7%.

Both charge $2.00 per million input tokens. Grok 4.5 is cheaper on output: $6.00 vs $12.00 per million tokens. Figures are base-tier rates. Rates are pay-as-you-go API prices verified on August 18, 2026.

Other comparisons